跳到主要内容
返回时间线
arXiv来源发表:

判决前残差流激活可预测LLM评判者的位置翻转,AUROC达.621–.850并跨基准迁移至.685–.853

核心概要

该研究在534个JudgeBench配对与1802个MT-Bench比较上,用嵌套分组交叉验证训练L2正则化线性探针,读取判决前残差流激活来预测LLM评判者因候选顺序交换而改变所选回答身份的位置翻转;四个评判者的AUROC为.621–.850,优于包含口头置信度、判决logit、长度差与初始选择的组合基线.062–.113,且冻结迁移到MT-Bench后AUROC为.685–.853。

AI-generated editorial illustration: Will the Judge Flip? Predicting Position-Sensitive LLM Judgments from Residual Stream Activations

深度剖析

判决前残差流激活可预测位置翻转:四个评判者在534个共享JudgeBench配对上的AUROC为.621(Llama-3.1-8B)至.850(Qwen3-8B),所有置信区间均排除.5。 以往识别位置翻转需要在两种候选顺序下各评判一次,属于事后检测;这里改为在单次评判过程中、判决token之前读取激活,直接预测该配对是否易翻转。 嵌套分组交叉验证,外层五折、内层三折,分组保持同一问题的变体在一起;特征标准化与模型选择仅在训练折内进行;每个比较恰好产生一个留出预测;95%置信区间用2000次以问题为重采样单位的分组自助法。

线性探针优于使用口头置信度、判决标签logit、回答长度差与评判者初始选择的组合基线,AUROC高出.062–.113,且所有配对置信区间排除零。 该基线已包含评判者的初始选择,因此提升不能仅由选择本身解释;在更严格的同选择匹配AUROC下,探针仍高出.108–.126,配对区间均排除零。 基线与探针在同一留出折上评估,并遵循相同的嵌套拟合流程;作者同时报告了AUPRC与Brier的配对差异,其中Qwen3-4B的AUPRC区间与Llama-3.1-8B的Brier区间包含零。

在JudgeBench上训练并冻结的线性探针无需适配即可迁移到MT-Bench,AUROC为.685–.853,所有95%置信区间高于.5。 迁移过程不使用MT-Bench进行拟合、阈值选择或重校准,说明该预测信号不局限于单一响应配对分布。 超参数由全部534个JudgeBench配对的 grouped 交叉验证选出,随后在完整JudgeBench上重新拟合并冻结一个探针及其标准化;MT-Bench的PFR为.172–.379,AUPRC在每个评判者上都超过翻转流行率,Brier低于固定为JudgeBench流行率的常数预测器。

重复呈现对照未发现同序判决变化:在预先声明的100对子集上,重复同序评判不改变任何判决,而交换顺序会改变19–47个判决(视评判者而定)。 该对照把观察到的翻转与确定性推理下的同序噪声区分开,支持翻转来自候选顺序而非采样随机性。 子集在推理前用配对标识符的种子哈希选出;所有评判在bfloat16下确定性生成,使用贪心解码与256 token生成额度。

启示与展望

该结果面向可获取残差流的开放权重评判者:四个相对较小的模型(Qwen3-1.7B、Qwen3-4B、Qwen3-8B与Llama-3.1-8B-Instruct)与两种响应配对分布。它使在单次评判中为配对打翻转风险分成为可能,从而有望把双序评判集中到高风险配对上;作者指出,未测试的设置仍需对抽样配对做双序评估。探针分数预测的是位置翻转风险,而非一般可靠性。

线性可解码性不等于模型因果地使用该信息,也不等于模型显式估计位置敏感性;残差流访问排除了闭源模型。共享分析集保留了JudgeBench池的86.1%与MT-Bench比较的75.1%,纳入要求两种候选顺序下每个评判者都产生有效输出,因此结论以格式合规为条件。组合基线未穷尽所有难度或不确定性度量,判决前置信度格式可能削弱口头置信度,且超越线性基线不排除其特征间的非线性预测关系。作者未评估风险阈值策略、实际节省的评判次数或包含激活提取的净运行时间。

来源