语义熵在GSM8K上以AUROC 0.871识别小模型错误,但合成算术上的同类结果被一个纯正则难度基线完全抵消
核心概要
该工作把语义熵用作小模型到大模型升级路由的信号,在三个基准和两个模型家族上测试,发现GSM8K上语义熵能可靠区分小模型错误(AUROC 0.871)并在等成本下比随机升级最多提升九个百分点,而合成算术上看似同样强的结果被一个仅凭题面难度、不含任何模型的正则规则几乎完全匹配;论文据此提出一套检查清单,包括难度基线、三种升级目标、oracle余量预检、逐次生成成本核算,以及一个可在实验前预测检索式捷径是否失效的难度探针,并提前预测了AUROC从0.908跌至0.518。
Figure 1: The cost-quality frontier on GSM8K ( r = 0.56 r=0.56 , γ = 12 \gamma=12 ), drawn from Table 10 together with the cost model of Section 3.4 (which supplies always-small’s cost of 1 1 unit; always-small has no row in Table 10 itself). Always-small and always-large never route, so they carry no AUROC and are shown as cost-only reference bars.
arXiv深度剖析
语义熵在GSM8K上能区分小模型错误并转化为真实路由收益:Target 2 AUROC 0.871,Target 1 AUROC 0.734,路由准确率在约0.56升级率处达到0.528,超过等成本随机升级并在约0.17至0.56升级率区间超过始终使用大模型。 此前语义熵主要用于幻觉检测,本文把它作为升级信号在完整路由管线中端到端评估,并同时报告操作相关的Target 1与公平的Target 2。 Gemma-3 1B/12B配对、GSM8K 1000题、每查询10个样本,AUROC带bootstrap区间;结果在两个不相交GSM8K样本上复现,Target 2两次相差0.008。
合成算术上语义熵看似很强的结果被一个零成本难度基线抵消:正则从题面恢复的难度直接打分得到Target 2 AUROC 0.839与0.830,与语义熵的0.830与0.867在噪声范围内不可区分,且符号在两次运行间翻转。 作者称此前级联研究未报告难度基线,该对照把作者自己最初接受的正结果转为零结果,并给出原始难度与校准难度两种变体、取二者最大值作为门槛的建议。 同一1000题合成集两次剖析,共享题集与模型对,仅重采样;熵与难度的秩相关为0.98,与Target 2标签的Somers' D为0.97,表明其判别力基本来自难度追踪。
升级目标的选择本身决定结论:needs_escalation依赖大模型行为,而仅由小模型样本计算的信号只能通过共享难度间接触及它,因此同一信号在Target 2上强、在Target 1上弱,合成算术上Target 1仅0.613与0.666。 论文把这一目标分歧作为核心概念发现,并指出Target 1的正例集中在难度中段、原始难度排序在路由器真正行动的一端是错的。 合成算术两次运行的Target 1与Target 2差距约0.2 AUROC,超过其测得的约0.02噪声下限;GSM8K上Target 3中熵0.639与原始难度0.633不可区分,与共享难度中介的解释一致。
实时语义熵路由的采样开销可能使其比直接调用大模型更贵,而基于缓存结果的检索式信号更便宜但更弱:1B/12B配对下实时熵每查询16.7单位对始终大模型12.0单位,检索为6.8单位、Target 2 AUROC 0.607。 论文把归一化成本模型掩盖的逐次生成开销显式化,给出盈亏平衡条件,并用一个无需模型调用的难度探针在运行GSM8K之前预测了检索式Target 3从0.908跌至0.518。 成本按参数量代理计算,作者明确说明真实服务成本还取决于批处理、量化、KV缓存带宽与硬件;检索结果与随机升级成本几乎相同(6.8对6.7)但提供了信号。
启示与展望
该工作面向在调用大模型之前决定是否升级的级联路由场景,适用于小模型与大模型能力差距足够大、且大模型能在小模型失败处成功的基准。其正结果针对GSM8K与Gemma-3 1B/12B配对,作者说明该配置在准确率上胜出但在成本上不划算,只有在大能力比或更小样本预算下才经济可行。检索式信号面向查询分布被知识库覆盖、且难度不是题面表层特征的场景,作者给出约6.8单位每查询、约为始终大模型成本57%的部署点。所提检查清单可直接用于其他升级信号与模型对的评估设计。
采样温度固定为1.0且从未消融,而它直接决定语义熵所度量的样本多样性;NLI蕴含阈值固定为0.5也未消融。知识库剖析未保留逐项分数,因此表9与表10的AUROC(包括作为检索讨论核心的Target 3崩塌)没有bootstrap区间,作者把重跑并保留逐项分数列为具体下一步。检索评估均为单次运行,GSM8K上较小的差异(如Target 1的0.570对0.656)在该精度下不可分辨。嵌入—难度相关与检索性能的关系仅有两个数据点,中间是平滑退化还是存在阈值未知。检索假设查询来自知识库覆盖的分布,稀疏覆盖下的行为未测试。作者还指出,本文记录的是他们恰好检测到的失效模式,可能仍有未被发现的同类问题。
