BayesJudge 将冲突的人类与 LLM 评判建模为后验分布,在 SummEval 上把专家预测准确率提升到 65.3%
核心概要
作者提出 BayesJudge,一个面向冲突人类-LLM 评判流的在线贝叶斯元评估层:它对每个比较输出后验裁决分布,同时估计每位人类评分者的混淆矩阵与 LLM 的呈现顺序偏差,并用开放式平局标签与 AB/BA 顺序互换作为协议级识别工具;合成实验恢复了预设评估者参数,在 SummEval 上检测到 LLM 位置效应、在无评分者元数据下区分专家与众包工作者行为特征,且后验不确定性与人类分歧相关。
Figure 1 : Motivating example. BayesJudge transforms heterogeneous, biased pairwise evidence into a probabilistic posterior verdict and diagnostics, rather than a single hard label. (a) Experts (E), crowdworkers (C), and LLM judges ( J A B J_{AB} , J B A J_{BA} ) provide conflicting observations; the simplex shows each channel’s distribution over true verdicts. (b) Hard reductions (majority vote, single-order LLM, swap heuristic) discard ambiguity and bias. (c) BayesJudge centers on latent π t \pi_{t} , jointly modeling human confusion C r C_{r} and LLM position bias β j \beta_{j} for streaming inference. (d) Outputs: posterior verdict, rater reliability C r C_{r} , LLM bias β j \beta_{j} , and entropy-based uncertainty H H .
arXiv深度剖析
BayesJudge 把冲突的人类与 LLM 评判当作证据而非噪声,对每个比较输出后验裁决分布(含平局/歧义状态),并同时推断评分者专属混淆矩阵与 LLM 呈现顺序偏差。 此前的 LLM 评判去偏方法与人类标注噪声建模分属两条互不相通的方向,且都输出单点聚合估计;该工作在同一在线框架内联合建模两类偏差源,并保留不确定性而非压缩为硬标签。 论文给出精确在线后验递推,并用 Rao–Blackwellized assumed-density SMC 做流式近似;主实验采用 hard-MAP 狄利克雷更新,soft 更新作为消融报告。
开放式平局标签与 AB/BA 顺序互换是协议级识别工具:前者使条目级歧义质量可观测,后者把条目偏好与呈现偏差分离。 论文以命题形式证明仅强制选择标签无法识别平局参数,且仅单一顺序时条目偏好与位置偏差相互混淆;这把顺序互换从鲁棒性启发式提升为可证明的识别设计。 合成流上,带平局标签时平局参数 MSE 衰减且偏差趋近于零,强制选择下 MSE 高一个数量级且偏差不收敛;单顺序似然给出明显有偏的均值估计,互换似然给出更紧的后验方差收敛。
在 SummEval 上,联合模型出现明显的评分者类型反转:仅人类通道对众包工作者预测较好(68.9% Acc)但在专家上失效(43.7%),仅 LLM 互换通道更贴合专家判断(59.5%),融合后取得最佳专家预测(65.3% Acc)与最低众包校准误差(ECE 0.042)。 MACE 通过折损低质量评分者在众包上达到 69.10% Acc 却在专家上崩塌(38.00% Acc),Bradley–Terry–Davidson 与 GLAD 在两组上都居中;该工作通过为每位评估者保留独立参数空间,让异质偏差在融合时相互约束。 采用 leave-one-human-out 预测协议,在 8 位评分者(3 专家、5 众包)与 GPT-4o-mini 双顺序判断上评估,报告 Acc、NLL、Brier 与 ECE。
后验熵与真实人类分歧正相关(Spearman 相关系数显著),可作为路由信号。 多数聚合方法只给出胜者,不提供条目级不确定性;该工作把后验熵作为默认不确定性分数,并说明它会在人类看似一致而 LLM 互换揭示隐藏歧义时给出高熵。 最低熵五分位(Q1)人类分歧最小,最高五分位(Q5)接近最大分歧,Q1 到 Q2 的跃升尤为明显;中段分桶并非严格单调,论文将其归因于模型同时条件于 LLM 互换证据与推断的评分者可靠性。
启示与展望
该框架面向成对比较的流式评估场景,适用于能够采集开放式平局标签并执行 AB/BA 双顺序调用的流水线,例如众包排行榜与自动基准评测。对希望获得条目级不确定性、评分者失败模式与评判者位置偏差审计信号的研究者与工程团队,它提供了可直接使用的诊断输出;论文的协议清单把平局标签、顺序互换、重复人类评分与重复评判者调用分别对应到可识别的量。合成实验用于验证参数恢复与结构正确性,SummEval 实验用于验证诊断有效性与预测可靠性,两者分工明确。
真实评估数据中每样本人类标注数量有限、且标注者不跨样本保持一致,这会限制评分者偏差模式的精确建模;论文目前只考虑 LLM 位置偏差,而实践中还有响应长度等因素影响判断;后验裁决分布的下游效用尚待直接验证。此外,理论保证针对精确后验目标,而实现使用 MAP-profile 势与 hard-MAP 狄利克雷更新作为可扩展的 assumed-density 近似,读者在需要精确覆盖时需注意这一区别。
