跳到主要内容
返回时间线
arXiv来源发表:

SAUCE 用滤波式序贯推断估计多智能体推理系统的不确定性,在五个骨干模型与两个协议上同时改善误分类检测、选择性预测与校准

核心概要

该工作提出 SAUCE,一种免训练的不确定性估计器,把并行多智能体推理中的不确定性建模为对潜在系统级信念的序贯推断:每轮以跨智能体一致度作为证据、以生成不确定性作为该证据的噪声权重,通过滤波式递推更新信念,并在五个骨干模型、五个基准与 Debate、DyLAN 两个协议上改善了误分类检测、选择性预测与校准。

Source-provided article image: Sequential Probabilistic Uncertainty Estimation for Parallel Multi-Agent Reasoning Systems
Figure 1 ·

Figure 1 : Overview. (A) Two MAS trajectories can reach the same final answer but differ greatly in reliability: a stable run whose outputs converge across rounds (top) is more trustworthy than an unstable run whose outputs oscillate (bottom). A static view that only considers the final output cannot distinguish them, motivating uncertainty estimation from interaction dynamics. (B) SAUCE models multi-round interaction as a sequence of round-level observations ( M t , R t ) (M_{t},R_{t}) , where agreement is weighted by generation uncertainty, and performs a filtering-style update over a latent system-level belief. The resulting trajectory summary defines the SAUCE uncertainty score u ⁡ ( 𝒙 , τ ) u({\bm{x}},\tau) (Eqn. 11 ).

arXiv

深度剖析

论文把并行多智能体推理系统的不确定性重新表述为对交互轨迹的序贯推断问题,而非对最终输出的静态打分。 此前单模型不确定性方法(采样式、贝叶斯式、内部信号式)并未直接处理多智能体结构;论文指出静态摘要对证据的时间顺序不敏感,两条平均信号相同但动态相反的轨迹会得到相同分数。 该论点由形式化定义支撑:轨迹被定义为多轮交互的采样结果,不确定性被写成随轮次递推更新的状态序列,并在第 4 节给出概率图模型解释。

SAUCE 用两个零额外成本的轮级信号驱动更新:模态答案占比作为跨智能体一致度,智能体平均 token 级预测熵作为生成不确定性。 一致度提供证据,生成不确定性决定该证据的更新强度,从而把跨智能体分歧与单智能体生成不确定这两类来源合并进同一个系统级估计。 信号定义明确(模态答案占比、基于 top-k log-probabilities 的 token 熵),且论文报告正确样本的平均置信度持续高于错误样本。

该递推被证明是线性高斯状态空间模型下的精确后验更新,轮级估计即潜在系统信念的后验均值,稳定性权重即其后验方差。 这为滤波式更新提供了概率解释,而非启发式加权;一致度充当潜在信念的含噪观测,生成不确定性充当观测噪声方差。 命题 4.1 给出后验均值与方差的闭式解,附录 D.1 以归纳法证明,附录 D.3 进一步说明该目标同时是精确边际似然与紧的 ELBO。

在五个骨干模型、五个基准、两个 MAS 协议上,SAUCE 在多数单元格和每个骨干平均上领先,并在长辩论中比末轮对数似然更稳健。 单模型分数(PE、LL)在 MAS 下常接近或低于随机水平,专用 MAS 估计器(UDPO、MATU)只在个别(模型、协议)单元格领先;消融显示增益来自序贯更新而非一致度与生成不确定性的静态组合。 主表报告 AUROC 与 AUARC 的完整网格,校准用 Platt 缩放后的 Brier 分数(5 折交叉验证),并附提示级自助法与重复 rollout 的均值与标准差;在 GPT-5.4-mini / BBEH-mini 上 SAUCE 接近随机水平。

启示与展望

该结果面向并行多智能体推理系统,即各智能体在每轮对同一问题给出可比答案、最终由多数投票等聚合函数给出预测的设定,Debate 与 DyLAN 是代表性协议。在此设定下,SAUCE 只需标准 rollout 中已有的解析答案与 top-k token log-probabilities,不需要额外采样、模型权重或隐藏状态,因此可直接用于只暴露 top-k log-probabilities 的闭源模型。超参数为标量,按 MAS 协议在单一校准单元上调好后跨模型与数据集迁移。对下游使用者而言,Platt 缩放后的逐轨迹置信度可作为门控信号,用于选择性预测、拒答或不确定性感知的编排;长辩论场景下保留早期轮次证据的做法比末轮置信度更稳定。

在 GPT-5.4-mini / BBEH-mini 上 SAUCE 的 AUROC 接近随机水平,重复 rollout 的均值同样接近随机,因此该任务上的相对优势不宜解读为可靠判别。附录 C.6 中交互历史与正确性的关系是描述性关联,论文明确说明不构成切换的因果效应,也不是校准后的正确概率。超参数敏感性研究只刻画了 Qwen3-4B / MMLU-Pro 这一校准单元,未界定逐单元调参在其他模型或数据集上的潜在收益。提示级自助法区间刻画的是固定 rollout 下的提示采样不确定性,不度量独立生成 rollout 之间的波动。此外,加载文本中部分数值(如基准规模、超参数取值、部分置信区间与尾概率)以占位形式出现,若需精确复现实验配置,应回到原文表格核对。

来源