跳到主要内容
返回时间线
arXiv来源发表:

清华LeapLab用二值方向奖励替代KL散度,在数学与代码基准上追平甚至超过在线策略蒸馏,并提出C-MOPD多教师方案

核心概要

该工作重新审视在线策略蒸馏(OPD)中反向KL散度的必要性,提出仅保留更新方向的二值奖励BinaryOPD,在数学与代码任务的多组师生配对上取得与OPD相当或略优的结果,并进一步发现只有教师与学生分歧较大的少量token的方向才是关键,据此提出让所有教师共同监督每个样本的C-MOPD,在数学与代码基准上稳定优于MOPD。

AI-generated editorial illustration: Do We Really Need KL Divergence for On-Policy Distillation of Large Language Models?

深度剖析

作者提出BinaryOPD:当教师概率高于学生概率时给该token奖励+1,低于时给-1,只保留更新方向、丢弃KL的幅度信息,用策略梯度目标训练学生。 传统知识蒸馏与OPD默认以反向KL散度作为损失,该工作把损失简化为符号级方向信号,并证明这一简化足以复现OPD的训练模式。 在数学上使用五组师生配对(如Qwen3-4B-Non-Thinking对Qwen3-4B-Non-Thinking-RL-Math,BinaryOPD平均65.1对OPD的64.1;Qwen3-1.7B-Base配对22.2对21.2),代码上两组配对(55.2对55.4),训练动态在准确率、熵与响应长度上趋势一致。

作者发现只有教师与学生分歧较大的少量token的方向是关键的:只保留高分歧token并使其更新朝向教师即可复现OPD,而一旦把这些token的方向反转,训练就会失败。 此前通常认为需要在整个词表分布上匹配教师,该工作把关键性定位到高分歧token这一小集合,并指出低分歧token即使被推离教师也不严重损害性能。 以log-ratio按阈值划分A、B、C三组做正负奖励对称实验:只保留Group A(少于全部token的一小部分)训练可行,加入Group C后训练失败;负奖励实验中只保留Group C可行,加入Group A后失败;低分歧的Group B占绝大多数token,移除它不破坏训练。

作者提出Consensus Multi-Teacher On-Policy Distillation(C-MOPD):每个样本由所有教师共同监督,教师方向一致时拉向所有教师,冲突时回退到领域教师且仅在冲突不强烈时采用其方向,否则给零奖励。 MOPD把每个样本路由给单一领域教师,跨域更新可能损害其他领域能力;C-MOPD改为全体教师共识式监督,避免这种能力冲突。 在Qwen3-4B-Non-Thinking学生、数学与代码两位教师的混合训练集上,C-MOPD在几乎全部数学与代码基准上优于MOPD,例如LiveCodeBench v6为32.9对27.9;过于保守的阈值设置会使零奖励比例单调上升并超过一定水平,性能仅与MOPD持平。

作者从状态冗余角度解释BinaryOPD为何可行:OPD训练中访问的状态高度冗余,同一或邻近状态被反复访问,因此重复的方向性反馈可以迭代地确定修正量,无需在单次更新中编码幅度。 该解释把KL幅度可被替代从经验观察提升为对OPD训练闭环反馈机制的一种说明,并指出状态探索很快饱和。 在Qwen3-4B学生与Qwen3-4B-Non-Thinking-RL-Math教师的DeepMath训练中记录30步、61,440个状态,跨提示最近邻余弦相似度均值0.893、中位数0.901,第1步的2,048个状态已为后续状态提供较高覆盖,库扩大约29倍后覆盖率提升有限。

启示与展望

该结果面向使用在线策略蒸馏进行LLM后训练的研究者与工程团队,适用于学生模型在自身rollout上接受教师token级监督的场景,例如数学推理与代码生成;BinaryOPD与C-MOPD可直接替换反向KL损失或MOPD的路由机制,代码已在LeapLabTHU/KL-Free-OPD公开。C-MOPD的实验设定为Qwen3-4B-Non-Thinking学生配数学与代码两位领域教师,训练集为DeepMath、CodeContests、TACO、APPS与Codeforces的混合。

高分歧token的判定依赖阈值,正文报告了不同阈值与另一组师生配对的补充实验,但阈值如何随模型与任务变化仍是开放问题;状态冗余分析基于固定的教师表示空间与单一学生-教师组合,其结论在其他表示或规模下是否同样成立值得继续观察;验证信号与更新方向相反时性能未受明显影响,这一现象与RLVR结合时的实际取舍仍需更多场景检验;此外,正文部分数值在解析文本中缺失,具体阈值与比例需查阅原文表格与附录。

来源