跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Seg-OPD 用教师重写片段训练学生修正推理,在数学与竞赛编程任务上平均相对提升 5.22%

该工作提出片段级在线策略蒸馏(Seg-OPD):先用受控推理干预发现把学生推理片段替换为教师重写能提升后续推理准确率,再基于不确定性度量选取学生片段并获取对应教师重写,训练学生偏好教师重写而非配对学生片段,同时保留稠密 token 级在线策略蒸馏监督;在数学推理与竞赛编程任务上,Seg-OPD 训练的模型修正成功率高于基线,推理准确率一致优于所比较的当前最优基线,跨多种模型与任务平均相对提升 5.22%。