跳到主要内容
返回时间线
arXiv来源发表:

同质面板LLM辩论中,冻结策略在6,925场MMLU-Pro辩论里阻止29次崩塌却丢掉108次纠正

核心概要

该工作提出一套可审计的同质三智能体LLM辩论协议,把最终准确率拆解为保持、崩塌、纠正与未修复四类转移并记录崩塌起始轮次与带符号干预效用,在6,925场MMLU-Pro辩论中识别出253次崩塌,并通过回放实验显示留一模型探针门控冻结在等权重下阻止29次崩塌却损失108次纠正,说明仅以阻止崩塌为目标的策略可能选错。

AI-generated editorial illustration: Measuring Collapse and Correction in Homogeneous-Panel LLM Debate

深度剖析

该工作把辩论评估从“最终答案是否变好”改为带方向的转移账本:崩塌指初始多数正确而最终多数错误,纠正指初始多数错误而最终多数正确,并记录崩塌起始轮次与带符号干预效用。 此前标准最终准确率评估把方向相反的两种机制混在一起;作者指出Sonnet 4.5与Llama-3.1-8B的辩论翻转率几乎相同,但Llama的条件崩塌率约为其四倍,缺失的变量是方向而非运动量。 在6,925场MMLU-Pro辩论上识别出253次崩塌,并给出并行的纠正账本;标签全部基于规则编码,不使用LLM评判或人工编码,解析器失败与并列规则敏感性均有审计。

回放实验揭示核心权衡:留一模型探针门控冻结在等权重下阻止29次崩塌,却损失108次纠正,净效用为负;简单第一轮多数变化门控与学习式第一轮树桩同样为负。 这改变了干预的判断方式:如果只看崩塌预防,会推荐错误的策略;作者因此主张任何动作策略都必须在声明的权重下用留出集带符号回放来评分。 探针门控行为冻结的留一模型聚合结果,以及独立轨迹队列上的第一轮回放行;在崩塌权重为10时探针门控冻结仍为负,而第一轮多数变化规则转为正。

一个紧凑的辩论前8探针筛查可作为分诊信号:其与条件崩塌风险的家庭级未调整关联很高(G=7,Spearman rho=0.893,精确双侧p=0.0123),但初始多数准确率是接近的免费比较项(rho=0.821;家庭偏相关rho=0.767,p=0.0877)。 作者明确不把它当作校准的或能力调整后的预测器,而是用于决定哪些模型-脚手架行值得付出昂贵的轨迹记录成本;在观察到初始答案后,分歧是更强的运行时诊断量。 探针测量本身可重复:分半信度、重测信度与智能体间ICC均有报告;模型行Spearman、留一家庭、分类学与测量误差自助法作为敏感性分析限定而非扩大该结论。

轮级轨迹把多数崩塌定位到第一轮:在253次崩塌中149次起始于第一轮,加入第一轮轨迹特征使汇总折外AUC从0.573升至0.658,加入第二、三轮后升至0.673。 这提供了运行时定位而非因果中介:早期分歧既可能先于有害级联,也可能先于有用的恢复,因此第一轮只是诊断基底,不是可独立部署的门控。 基于辩论索引自助法的配对置信区间,以及四轮轨迹模式的复现;贝叶斯多层logistic模型中模型级斜率的高密度区间跨零,作者据此把定位读作轨迹定位而非因果中介。

启示与展望

该协议面向同质、闭卷、三智能体选择题辩论这一刻意狭窄的设定,主要基准为MMLU-Pro;其可复用产物是一套行模式、规则化编码器、解析与稳定性审计、成本核算、发布标记与零API重建脚本,使新的模型-脚手架行能在相同分母与带符号效用账本下比较。对读者而言,这意味着当你要评估一个辩论、评判-辩论、弃权或延迟系统时,可以先建立初始多数与最终多数的转移表,报告条件崩塌、纠正与起始轮次,再把任何门控策略放到留出集上按声明的崩塌/纠正权重做带符号回放;探针筛查适合在决定哪些模型-脚手架行值得昂贵轨迹记录时使用,而第一轮轨迹特征适合在辩论已经开始后做运行时诊断。作者也把发布分层:聚合表与代码开放,说服性探针模板与完整转录按研究用途门控,因此复用者需要显式声明哪些矩阵缺失或被门控。

读者仍会关注若干开放问题。筛查的边际价值有限:初始多数准确率是接近的免费比较项,家庭级偏相关在控制初始准确率后不再具确证性,因此它更适合分诊而非逐题预测。第一轮定位是诊断而非因果中介,早期分歧同时先于有害级联与有用恢复,把信号转成净准确率收益仍需要模型感知的成本函数与互补策略。范围之外的情形包括异构评判-辩论系统、工具使用、检索、自由生成、评分标准或评判打分答案,以及需要更长上下文收集证据的智能体工作流;混合模型面板与GSM8K行只是可行性检查。推理模式行显示崩塌与纠正同时存在,但并未确立辩论优于算力匹配的单体推理基线。此外,逐场第一轮特征矩阵与严格匹配的分歧门控矩阵仍被门控,因此相关结果属诊断性质;闭源API行可能随提供方更新而漂移,探针回复温度对筛查的稳健性也仍未解决。

来源