RL-ARC 用推理置信度校准答案置信度,在分布外基准上把 ECE 降到 0.16 并保住准确率
核心概要
该工作提出 RL-ARC,一种校准感知的强化学习框架,在 RLVR 基础上同时提取模型对推理过程的置信度与对答案的置信度,把推理置信度作为辅助信号:预测正确时用它正则化答案置信度,预测错误时用它施加过度自信惩罚;在数学推理与分布外复杂推理、事实问答基准上,RL-ARC 的校准指标优于既有校准感知训练方法,同时准确率与仅优化正确性的 RLVR 相当。
Figure 1: Comparison of reasoning training frameworks: (a) Standard reasoning training often assigns high confidence to incorrect answers (i.e., overconfidence). (b) Previous calibration-aware training reduces overconfidence to some extent, but still tends to assign high confidence to incorrect answers on OOD benchmarks. (c) Our RL-ARC consistently improves calibration while preserving accuracy gains under OOD settings.
arXiv深度剖析
RL-ARC 把推理置信度作为校准答案置信度的辅助信号,并按预测对错采用不同目标:正确时做推理引导正则化,错误时施加过度自信惩罚。 此前的校准感知训练方法主要只校准答案置信度,未考虑推理过程本身的可靠性;RL-ARC 让模型在估计置信度时同时参考推理过程与预测的正确性。 论文给出校准感知目标函数(式 5、式 6),并用消融实验(表 5)显示两类目标作用不同:错误样本上的过度自信惩罚取得最好的 Brier 与 ECE,正确样本上的正则化则改善准确率、AUROC 与 AURC。
在 ID 与 OOD 基准上,RL-ARC 的校准优于多种置信度估计与校准基线,同时准确率与仅优化正确性的 RLVR 相当。 既有事后校准方法在 ID 上校准有竞争力,但其有效性未能一致迁移到 OOD;既有校准感知训练方法在 OOD 校准上较稳健,却常伴随明显的推理性能下降。 以 Qwen2.5-7B 为例,OOD 平均 ECE 从 RLVR 的 0.50、RLCR 的 0.20 降到 RL-ARC 的 0.16,准确率 47.27 与 RLVR 的 47.58 接近;Qwen3-8B 上 OOD 平均 ECE 为 0.17,准确率 51.61。
RL-ARC 在分布偏移下让置信度更好地反映预测正确性,并把更多样本分配到低、中置信度而非集中于高置信度。 此前训练方法在 OOD 下仍把大量预测集中在高置信度区域,RL-ARC 的置信度分布更分散,对不确定问题给出低或中等置信度。 论文报告 OOD 基准上的置信度感知校准分析(图 3)与置信度分布分析(附录 B.2),并给出随机打乱置信度但保持直方图不变的对照实验(表 7),RL-ARC 的 ECE 与 Brier 仍低于打乱版本。
除预测层面的校准外,RL-ARC 还改善了推理校准并减少了浅层推理。 既有校准感知训练方法主要关注答案校准,RL-ARC 显示引入推理置信度可间接让推理置信度与推理正确性对齐,且无需对推理正确性做直接监督。 论文报告推理校准与浅层推理频率指标(图 6),其中推理校准的提升幅度明显大于答案校准的提升,且浅层推理下降幅度最大;推理正确性由 LLM-as-a-judge 判定。
启示与展望
该结果面向用 RLVR 类方法训练的语言推理模型,适用于需要按置信度筛选输出的场景,例如高风险领域中的可靠性判断。论文在数学推理(Big-Math、GSM8K、MATH-500、AMC23、AIME24、AIME25)与分布外的复杂推理(StrategyQA、GPQA、HotpotQA)及事实问答(SimpleQA、NQ-Open、TriviaQA)上验证,并额外用 HotpotQA 作为替代训练分布;方法在 Qwen 与 Llama 家族、两种训练分布下均报告了校准改善与准确率保持。
推理校准与浅层推理依赖 LLM-as-a-judge 判定推理正确性,论文指出该判定可能引入误差,因此这两项指标应视为有待更精确评估方法验证的信号。实验仅覆盖两种训练设置并统一使用 GRPO,向更多训练数据、更强 RL 算法与多模态推理模型的扩展仍是开放问题。此外,超参分析显示增大推理置信度的影响并不必然带来进一步校准改善,最优配置以正样本主导为主,说明两类辅助目标的平衡需要按场景调参。
