跳到主要内容
返回时间线
arXiv来源发表:

DCSD把自蒸馏的信用方向与幅度拆开:11个基准总体最优,数学推理较基座提升8.45分

核心概要

该工作提出解耦信用自蒸馏(DCSD),用信念边际探测确定每步推理的信用方向、用边际信息增益量化其贡献幅度,再让特权教师只负责步内token分配,在11个数学与多模态推理基准上总体得分优于GRPO、OPSD、RLSD与RLCSD,相比基座模型数学推理总体提升8.45分、多模态推理提升7.01分,并纠正约6% token的信用方向、使token信用幅度降低约1.5倍。

AI-generated editorial illustration: Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation

深度剖析

论文形式化了自蒸馏中的"oracle步级信用",并证明在"以最终成功为条件的策略"下,自蒸馏对数比与oracle局部RL优势在方向上一致,但幅度并不等于该步的贡献。 此前OPSD把信用方向与幅度耦合在同一个教师信号里,RLSD、RLCSD则把方向锚定在轨迹级优势上;该工作把"方向一致性"与"幅度不可直接对应"作为两条可分别处理的性质明确区分开。 结论来自论文第2节的理论推导(式1至式3及附录B),属于分析性论证,而非实验测量。

DCSD用信念边际探测(belief-margin probing)判断每一步是把学生信念推向还是推离正确答案,用边际信息增益(marginal information gain)量化该步相对前文带来的非冗余信息,从而分别确定信用方向与幅度。 与直接使用教师信号、或把方向锚定到轨迹级优势的做法不同,DCSD把教师限制在"步内token分配"这一角色,教师变化只能重分配步内信用,不能改变已确定的步级方向与总幅度。 方法由第3节与附录C给出完整构造,并配有定理1至定理4;其中方向选择在置信阈值内才覆盖轨迹级方向,否则回退到轨迹级方向。

在11个基准上DCSD取得总体最优:数学推理(Qwen3-4B)总体88.56,高于GRPO的84.70、RLSD的83.86、OPSD的80.11与基座的81.40;多模态推理(Qwen3-VL-8B-Instruct)总体61.14,高于RLSD的58.19、GRPO的55.49、OPSD的54.13与基座的53.43。 相比基座模型,数学推理总体提升8.45分、多模态推理提升7.01分;多模态中WeMath提升最明显(54.10升至67.05),而ZeroBench是例外,DCSD低于RLSD。 结果为mean@4准确率,数学与多模态基线分别沿用共享设置与RLSD已发表设置;多模态仅训练DCSD、基线结果取自RLSD表2。

训练动态与教师信号诊断显示:DCSD约纠正6% token的信用方向(含成功轨迹中的负向纠正与失败轨迹中的正向纠正),信用幅度衰减在训练中保持稳定;在固定90道AIME24–26题目、仅改变特权信息的C0–C4条件下,DCSD的Top-1不一致率与平均绝对误差均低于OPSD与RLSD。 论文用条件匹配的Qwen3-32B作为"操作性oracle"参照,并指出DCSD在C0(不提供答案信息)时已具优势,说明改进不能仅归因于额外答案信息。 诊断基于冻结的Qwen3-4B响应(每条件1,098,216个token)与配对自助法区间;作者明确把Qwen3-32B当作oracle的代理,而非真实oracle。

启示与展望

该结果面向使用特权教师的自蒸馏式策略优化,适用于数学推理与多模态推理两类训练设置:数学侧以Qwen3-4B与DAPO-17K训练,多模态侧以Qwen3-VL-8B-Instruct与MMFineReason-123K训练。方法层面,它使教师证据在步级方向与幅度已确定后只承担步内token分配,因此对教师措辞、答案呈现方式等偏好变化的敏感度下降;论文报告DCSD每步训练开销高于OPSD,但生成仍是主要成本,端到端增幅有限。对读者而言,这提供了一条可复用的设计原则:把"该往哪个方向更新"与"该给多少信用"分开处理,而不是让同一个教师信号同时决定两者。

论文把条件匹配的Qwen3-32B当作"操作性oracle",因此TDR与MAE衡量的是与更强模型参照的一致性,而非与真实oracle的一致性;作者也说明"certified"仅指满足定理2误差预算条件的探测步,而非全部经验覆盖。多模态实验中只训练DCSD、基线结果取自RLSD已发表设置,ZeroBench上DCSD低于RLSD,作者将其归因于细粒度视觉感知与空间推理带来的误差,这类误差无法仅靠信用校准解决。此外,方向纠正率约6%、幅度降低约1.5倍等数字来自训练日志统计,其聚合口径在附录E.3中定义;若读者只读到摘要与主表,这些口径细节需要回到附录确认。更长程与交互式推理场景被作者列为未来工作,尚无论证。

来源