跳到主要内容
返回时间线
arXiv来源发表:

ProbeGuard 用共识形成过程而非终局一致率,在 MedQA 一致层以 9.0% 实测风险认证作答 55.3% 的问题

核心概要

该工作提出 ProbeGuard,一个基于多轮共识形成过程而非终局一致率的认证弃答框架:它从系统执行日志提取轨迹特征,对首轮一致票用理由语义熵与主动反证探针检验共识是否由知识支撑,再用分层 Learn-then-Test 校准给出无分布假设的选择性风险界;在 MedQA 上终局一致率仅 0.512 AUROC,过程分数达 0.696,一致层中 13.4% 的一致票是错的,认证规则以 9.0% 实测风险作答该层 55.3% 的问题。

Source-provided article image: Unanimously Wrong: Certified Abstention from How Medical LLM Consensus Forms
Figure 1 ·

Figure 1: Two unanimous consensuses are indistinguishable to snapshot-based abstention (a), yet one is knowledge-backed and one is inherited from a shared misconception. ProbeGuard (b) checks whether the rationales behind a unanimous vote support one another and stress-tests the consensus with retrieved counter-evidence, answering only where selective risk is certifiably bounded.

arXiv

深度剖析

终局一致率作为弃答信号在多轮共识系统中失效:由于系统一旦达成一致即停止审议,每个收敛问题的终局票都是 1,因此终局一致率在 MedQA、MMLU-Pro 医学、MedMCQA 上均处于随机水平(0.512、0.504、0.507 AUROC)。 此前一致率类信号(自一致性、语义熵、conformal abstention)都建立在单轮采样之上,本文首次把这一失效模式在多轮共识系统上量化,并指出其根源是早停规则使终局票恒定。 三个基准、三个骨干(Qwen3-8B、HuatuoGPT-o1-8B、Llama-3.1-8B)共七个单元格中终局一致率全部处于随机水平,附录 F 给出完整网格。

共识的形成轨迹携带终局票所没有的信息:过程分数把正确与错误共识的区分度从随机提升到 0.696(MedQA)、0.704(MMLU-Pro 医学)、0.659(MedMCQA),并在 MedQA 与 MedMCQA 上取得最低选择性风险。 轨迹特征(轨迹平均一致率、多数翻转次数、少数派持续性、文档重复率)全部来自系统本就写出的执行日志,零额外推理成本;消融显示只有理由族不可替代,轨迹各族彼此冗余。 34 个特征分五族,用 L2 正则逻辑回归在问题级交叉验证下拟合;附录 H 的逐一剔除矩阵显示去掉理由族使 MedQA AUROC 从 0.696 降到 0.682,去掉其他族则不变或略升。

在首轮即全体一致的“一致层”上,所有投票类信号恒定,但错误率很高:MedQA 一致层占 59%、其中 13.4% 是错的(746 票中 100 票错),MMLU-Pro 医学 17.7%、MedMCQA 22.3%,专家级 MedXpertQA 上 79.0%。 本文把语义熵从答案层下移到理由的结论句,并引入主动反证探针:错误共识在反证下翻转 14.0–26.5%,正确共识仅 3.3–5.5%,这一不对称在七个单元格中稳定存在。 对照臂把翻转归因于检索内容本身:仅给魔鬼代言人指令翻转 0 票,无关文档只翻转 1.0% 的错误共识,中性指令下的反证仍保留几乎全部不对称(12.0% 对 3.6%)。

分层 Learn-then-Test 校准把过程分数转成无分布假设的选择性风险界:在 MedQA 一致层,组合分数以 9.0% 实测风险认证作答 55.3% 的问题(50 次划分),约合全部 MedQA 问题的 32%;用域内一致问题扩充校准集后,认证覆盖率升至 89.2%,并首次在更严目标下认证 21.9%。 此前医学弃答方法给出的是启发式分数、阈值无误差保证;本文按过程分层认证,使在投票类信号恒定的层上也能给出非零覆盖的保证。 50 次随机划分中每个 Learn-then-Test 臂的违规比例为 0/50,即没有一次划分的实测测试风险超过目标;不分层时朴素分位校准在 MedQA 上实测风险 15.7% 未达标,全局 Learn-then-Test 则返回不了任何认证阈值。

启示与展望

该框架面向按轮审议并写出执行日志的问答系统,部署方可在自身病例组合上校准 ProbeGuard,把认证区域之外的问题转交临床医生,且每个被转交问题都附带其反证文档与异议记录,使医生看到系统为何拒答。保证适用于基座错误率不高于目标风险的任何分层;高于目标的分层不会获得认证区域。更紧的证书需要更多校准数据,而域内一致问题会随系统运行自然累积。附录 I 显示同一校准可按专科重跑,急诊医学的一致层错误率约为层均值的两倍,是需要更保守路由的专科。

评测限于多选题基准,翻转不对称与理由信号能否迁移到自由文本临床问题尚未检验;三个骨干均为 8B 级模型、单一已发表基座,信号定义可迁移但未在他处实测。证书依赖分层内校准与部署同分布的假设,因此部署需按自身病例组合校准并在分布漂移时重新校准。临床医生是否认为返回的异议记录有用尚未评估,前瞻性临床评估是下一步。此外,正文中若干公式与超参数表在本次解析中未完整呈现,若需复现具体数值应查阅原文附录。

来源