跳到主要内容
返回时间线
arXiv来源发表:

当裁判学会说“我不确定”:决策式评判与置信度级联

核心概要

该研究把只输出判决与标签概率的决策式评判器 JEV 与十六个生成式与奖励模型评判器在偏好、事实性与答案裁定任务上对比,并配合盲法人工裁定,发现它在普通偏好与有证据支撑的事实性判断上距最强对比模型 GPT-6 不到三个百分点而费用约为其 0.36%,差距主要集中在低置信度决策上,因此一个“置信即接受、不确定即升级”的冻结级联可在更低成本下保留约 99% 的对比模型准确率。

AI-generated editorial illustration: JEV-as-a-Judge: Accept When Confident, Escalate When Unsure

深度剖析

决策式评判器在普通偏好与有证据支撑的事实性任务上接近最强生成式评判器,但成本低一到两个数量级。 此前 LLM-as-a-judge 的效率讨论多集中在生成式评判器与路由算法上,这里给出的是一个托管决策式接口的实测运行画像:JEV 在 RewardBench 得 92.2%(GPT-6 为 93.5%)、在 HaluEval 得 87.5%(GPT-6 为 86.7%),中位延迟 0.152 秒、每千次判断约 0.044 美元,而 GPT-6 为 1.885 秒与 12.182 美元。 1,312 条基础判断、十七种配置、按源问题聚类的自助法区间,并对两个评判器判断不一致的条目做了盲法人工裁定;作者同时说明该裁定由一名团队成员完成全部条目,并非大规模共识。

差距不是均匀分布的,而是集中在需要检查多步推导或抵抗“写得更漂亮但错误”的答案时。 这把“便宜裁判够不够用”的问题从整体准确率拆成了工作负载画像:JudgeBench 上 JEV 78.6% 对 GPT-6 93.1%,推理 68.4% 对 95.9%、编程 76.2% 对 97.6%;RM-Bench 上同风格配对 84.0%,而被拒答案写得更详尽时降到 74.8%。 JudgeBench 350 对、RM-Bench 每条件 480 次判断,均为配对比较并给出源聚类区间;人工裁定在 69 个争议条目中 57 次支持 GPT-6、1 次支持 JEV。

评判器的置信度能排序它自己的错误,从而支撑自动升级。 论文没有提出新的路由算法,而是给出一个冻结阈值策略:按两种顺序评判并平均对齐后的概率,置信则接受、不确定则交给更强模型。 在 990 条基础顺序判断上,最大标签概率低于 0.5 的条目准确率 47.7%,0.5–0.8 为 76.5%,0.8–0.95 为 93.9%,0.95 以上为 99.1%;冻结的两顺序策略在 510 对扩展样本上接受 53.7%、得 92.5% 对 GPT-6 的 93.1%,费用为后者的 56.8%。

置信度信号只在第一级评判器“胜任但不确定”的地方有效,在它被风格误导而自信出错的地方会失效。 这为级联的适用范围划了边界:RM-Bench 困难配对上置信度对正确性的 AUROC 降到 0.770,级联只能保留 GPT-6 的 96.5%;无参考的自然散文上 AUROC 为 0.518,任何阈值都无帮助。 同一批提示上的配对比较,含九种风格组合与两种顺序;作者明确说明这些阈值是在被评分的条目上读出的,只有冻结的两顺序策略才是预先设定的检验。

启示与展望

该结果面向的是带有参考或证据段落、或属于普通偏好判断的评测工作负载:在这些场景下决策式评判器可在低得多的费用下接近最强评判器,并可用置信度把不确定条目升级给更强模型。它不适用于需要检查多步推导、需要抵抗更详尽错误答案、或需要对无参考自然散文做事实判断的场景,论文明确建议这些场景升级或先做本地验证。作者给出的落地方式是:成对判断跑两种顺序并平均对齐概率、在本地选择集上选阈值并在留出条目上复核、把无效输出计为错误、把置信度当作升级信号而非正确性证书,并在扩展到新工作负载前做小规模本地验证。

读者仍会关注几处开放问题:多家族比较是在看过原始结果之后扩展的,属探索性;人工裁定覆盖的是评判器分歧选出的 183 个条目而非随机审计,且由一名团队成员完成全部条目、由作者裁定分歧,36 个最终标签为不确定;温度缩放并未在所有工作负载上迁移,拟合出的温度在不同任务上方向相反;单顺序级联的阈值是在被评分的条目上读出的,只有冻结的两顺序策略是预先设定的检验;延迟来自单一客户端位置与采集窗口,费用为估算而非账单;训练重叠与基准污染未知,专业领域未测试。此外,本次加载的是完整正文,但表格中的部分区间数值在文本中未完整呈现,若需精确区间应查阅原文表格。

来源