跳到主要内容
返回时间线
arXiv来源发表:

TTCL 在无标签目标数据上同时提升大模型推理准确率与置信度校准,基座模型平均相对准确率提升 40.13%、ECE 降低 70.80%

相关研究与后续进展

核心概要

该工作提出免标签的测试时校准学习框架 TTCL,从多个模型自生成回答中导出正确性与校准的自监督信号,在无真值标签的目标任务数据上联合适配推理准确率与言语化置信度,并在数学推理与事实问答上报告了准确率与校准的同步改善。

Source-provided article image: Test-time Calibration Learning for Large Language Model Reasoning
Figure 1 ·

Figure 1: Overview of our work : TTCL enables label-free calibration learning directly on unlabeled target-task data, consistently improving reasoning accuracy while reducing calibration error across models and tasks, with confidence progressively aligning with accuracy during test-time learning.

arXiv

深度剖析

TTCL 是一个免标签框架,直接在未标注的目标任务数据上联合适配推理准确率与言语化置信度,其自监督信号来自多个模型生成回答。 此前的校准学习通常被并入强化学习,并依赖真值正确性监督;TTCL 把校准学习移到测试时,不再需要真值标签,从而面向真值不可得、且校准需适应新遇到目标任务的实际部署场景。 摘要说明自监督信号由多个模型生成回答导出,并称理论分析将 TTCL 确立为理想校准目标的有界代理;具体推导与实现细节未在摘要中给出。

在基座模型上,TTCL 在八个基准上取得平均相对准确率提升 +40.13%,ECE 降低 +70.80%。 该结果把免标签测试时校准的效果量化为跨八个基准的平均相对改善,覆盖数学推理与事实问答两类任务。 摘要报告的是跨八个基准的平均相对数值,未给出逐基准结果、模型规模或样本量。

在源域校准向目标任务迁移较差的情形下,TTCL 仍能进一步提升已校准模型在域偏移下的准确率与校准;数学到事实问答设置中平均相对准确率增益 +20.35%,ECE 降低 +53.83%。 这扩展了适用面:不仅基座模型受益,已经过校准的模型在域偏移下也可继续改善,尤其是源域校准迁移不佳时。 摘要给出 math-to-factQA 设置下的平均相对数值,未报告逐任务分解或统计检验。

理论分析将 TTCL 刻画为理想校准目标的有界代理。 这为免标签自监督校准提供了与理想目标之间的理论联系,而不仅是经验性方法。 摘要仅陈述该结论,未给出界的形式、假设条件或证明结构。

启示与展望

该工作面向测试时真值标签不可得、且校准需适应新遇到目标任务的部署场景,适用于数学推理与事实问答两类任务,并覆盖基座模型与已校准模型在域偏移下的情形。摘要称源代码已释放,便于在同类任务上复现与扩展。其价值在于让模型在无标签目标数据上同时调整答案正确性与言语化置信度,从而支持对不确定预测的识别与更可靠的决策。

摘要未说明自监督信号的具体构造方式、多个生成回答的采样与聚合策略、有界代理结论所依赖的假设,也未给出逐基准结果、模型规模、样本量与统计检验。ECE 降低以“+70.80%”这类相对形式表述,其基线取值与计算口径需在正文确认。此外,摘要未说明在何种任务或数据条件下该方法可能不适用,这些均属可在原文中进一步查证的范围。

来源