BaRe-Mem 用贝叶斯可靠性记忆让中心模型在误导性建议增多时转向自主推理,并在 MuSiQue 上更早找到能干的工作者
核心概要
该工作提出 BaRe-Mem,一种在线贝叶斯可靠性记忆,它依据中心模型的内部信念表示估计顾问可靠性、用可靠性调制注意力并决定是否咨询;在九个基准和六个中心模型上,它比辩论与多数投票更抗误导信息,在更具挑战性的任务上于全部测试误导水平下仍高于自主推理,并在 MuSiQue 的智能体团队路由中比按历史成功次数路由更早识别出有能力的工作者。
深度剖析
BaRe-Mem 把顾问可靠性建模为以中心模型内部信念表示为条件的贝叶斯线性回归,并用卡尔曼增益做秩一在线更新,从而在稀疏验证反馈下也能得到可用的可靠性估计。 既有记忆方法或保存文本轨迹与摘要,或保存持续隐状态,但未显式建模“以中心模型对当前问题的内部信念为条件的顾问可靠性”;BaRe-Mem 让可靠性随任务流在线扩展并适应顾问可靠性的变化。 论文给出后验推导、卡尔曼增益的最小均方误差证明、秩一更新与顺序无关性证明;实验显示在约 170 个样本以下的稀疏反馈区间就已明显优于无反馈设置,随后收益趋于饱和。
可靠性估计被用于调制注意力:对每个顾问响应 token,按相对可靠性在 softmax 前缩放其未归一化注意力权重,最可靠顾问保持不变,较低可靠顾问被逐步降权。 该机制不引入可训练参数、不需要额外训练,只依赖顾问之间的相对可靠性,把“信任谁”直接写进注意力而非提示词或参数更新。 消融“Advisors + memory”保留可靠性引导注意力但去掉自主选项,在能力支持型场景中常足以维持稳定表现,说明历史可靠性估计确实降低了咨询对误导性顾问响应的敏感度。
BaRe-Mem 进一步比较估计的咨询能力与自主能力,逐题决定是否咨询;在能力挑战型场景中,随着误导信息比例升高,咨询比例大幅下降,而准确率仍高于自主推理基线。 仅做相对顾问加权只能决定“更信任谁”,无法判断整个顾问池是否值得咨询;BaRe-Mem 补上了这一缺口,使中心模型在外部证据整体不可靠时选择依靠自己。 表 1 中,能力挑战型场景下 Qwen3-14B 的咨询比例从 90% 降至 21%、Phi-4 从 85% 降至 18%,而 BaRe-Mem 在全部测试误导水平下保持高于“No consultation”基线;预测的咨询增益与验证后的真实增益随误导比例上升同步下移,曲线在预测增益接近零处穿过零点。
同一可靠性记忆被扩展到智能体团队的工作者路由:在 MuSiQue 的 2,417 个任务、6,404 个子任务上,BaRe-Mem 在两种 lead agent 与全部验证设置下取得最高任务完成率,并在更少的工作者调用次数下达到更高完成度。 与按历史成功次数路由相比,BaRe-Mem 把工作者可靠性条件化到当前子任务,而非只用聚合的源级成功率;这使它在小工作者预算下优势最大。 所有路由策略在尝试全部七名工作者后趋近同一上限,差异体现在达到该上限所需的工作者调用次数;在数据集验证器检查下,任务完成率超过历史成功次数路由若干百分点,且该优势在无检查、lead agent 检查与数据集验证器检查三种设置下持续存在。
启示与展望
该结果面向需要多智能体咨询与团队路由的部署场景:中心模型可访问内部信念表示、能获得间歇性的验证正确性反馈,并运行在长时程任务流上。它适用于能力异质、顾问可靠性随任务变化的设定,也适用于把子任务分配给工作者的智能体团队;论文用 MuSiQue 数据集提供的子任务来隔离路由效果,因此路由收益的适用范围是任务分解质量已固定的情形。对希望减少对昂贵验证依赖的实践者,稀疏反馈实验说明少量已验证交互即可产生可用的可靠性估计。
可靠性估计在高误导比例下仍高于经验准确率:论文指出在 100% 误导时经验准确率接近 0,而估计值仍在 0.2 左右,并将其归因于预测映射中残留的单位观测噪声,作者称这是“an illustrative limit rather than a universal lower bound”。因此读者仍需关注估计校准与决策阈值在极端误导环境下的表现。此外,团队路由实验使用数据集提供的子任务以隔离路由效果,任务分解质量本身的影响未在此设定内考察;报告检查的效果也随 lead agent 不同而变化,论文提到对六个 lead 模型中的五个,lead agent 检查优于无检查,而 Ministral-8B 的表现不同。这些都属于后续可继续观察的范围。
