跳到主要内容
返回时间线
arXiv来源发表:

Seg-OPD 用教师重写片段训练学生修正推理,在数学与竞赛编程任务上平均相对提升 5.22%

相关研究与后续进展

核心概要

该工作提出片段级在线策略蒸馏(Seg-OPD):先用受控推理干预发现把学生推理片段替换为教师重写能提升后续推理准确率,再基于不确定性度量选取学生片段并获取对应教师重写,训练学生偏好教师重写而非配对学生片段,同时保留稠密 token 级在线策略蒸馏监督;在数学推理与竞赛编程任务上,Seg-OPD 训练的模型修正成功率高于基线,推理准确率一致优于所比较的当前最优基线,跨多种模型与任务平均相对提升 5.22%。

Source-provided article image: Learning to Revise Reasoning with Segment-wise On-Policy Distillation
Figure 2 ·

Figure 2: Effectiveness of teacher redrafts and segment selection. (a). Reasoning accuracy of initial/OPD-trained students with/without teacher redrafts on AIME24. (b). After replacing segments selected with random/pivot anchors with teacher redrafts, the reasoning accuracy (bars, left axis) and revision success rate (lines, right axis) of Qwen3-4B on AIME26.

arXiv

深度剖析

论文指出 token 级在线策略蒸馏(OPD)不会显式给出一个连贯的替代推理步骤来说明学生的某一步应如何被改写以改善后续推理,并且当学生产生退化推理前缀时,后续教师监督仍以该前缀为条件,可能强化不良推理模式。 把问题从逐 token 监督重新表述为“学习修正推理”,即对中间推理步骤进行改写以更好支撑后续推理,而不是仅在原有前缀上继续施加稠密监督。 该论断来自对 OPD 范式机制的分析性陈述,原文以“does not explicitly provide a coherent alternative reasoning step”和“may reinforce poor reasoning patterns”表述,属于问题动机层面的论证。

通过受控推理干预,作者发现用教师重写替换学生片段可以提升后续推理准确率。 这一干预结果为“教师重写可作为修正信号”提供了直接依据,从而支撑把教师重写转化为显式监督的设计选择。 证据来自受控推理干预实验,原文以“Through controlled reasoning interventions, we find that replacing student segments with teacher redrafts improves subsequent reasoning accuracy”陈述,未在摘要中给出具体数值或样本规模。

论文提出 Seg-OPD:基于不确定性度量选取学生片段并获取对应教师重写,训练学生偏好教师重写而非其配对学生片段,同时保留稠密 token 级 OPD 监督。 相对 token 级 OPD,新增了片段级的选择机制(不确定性度量)与偏好式监督目标,使修正能力成为可训练对象,而非仅依赖逐 token 分布匹配。 方法描述来自摘要中的机制说明,包含片段选择依据、配对重写与偏好训练目标,以及保留 token 级监督的组合方式。

在数学推理与竞赛编程任务上,Seg-OPD 训练的模型修正成功率高于基线,推理准确率一致优于所比较的当前最优基线,跨多种模型与任务平均相对提升 5.22%。 把片段级修正监督的效果落到可比较的准确率指标上,并报告了跨模型、跨任务的平均相对改进幅度。 证据为数学推理与竞赛编程上的广泛实验,原文报告“higher revision success rates than baselines”与“average relative improvement of 5.22%”,并说明代码已公开。

启示与展望

该工作面向以在线策略蒸馏提升大语言模型推理的训练场景,适用于学生模型在数学推理与竞赛编程这类多步推理任务上产生中间步骤、且存在更强教师模型可提供重写的设定。其可用性依赖两个前提:能够按不确定性度量选出值得修正的学生片段,以及能够获得对应的教师重写。对希望复现或扩展的研究者,公开代码提供了起点;对工程实践者,这一思路指向在既有 token 级蒸馏流程中叠加片段级修正监督,而非替换原有监督。

摘要未说明不确定性度量的具体形式、片段粒度与选取阈值,也未列出所比较的基线、模型规模、数据集与评测协议,因此 5.22% 这一平均相对提升的构成与波动范围仍需在正文中确认。修正成功率的具体定义与测量方式同样未在摘要中展开。此外,受控推理干预的规模与统计强度未给出,教师重写质量对结果的影响也属于可进一步考察的方向。

来源