OG-OPSD 用结果正确性选择 KL 方向并按熵截断前缀,在 Qwen3 1.7B/4B/8B 上把数学推理平均分提升至 44.4/64.9/66.4
相关研究与后续进展核心概要
该工作从 RLVR 的优势视角分析在线自蒸馏(OPSD),发现固定散度目标对错误轨迹惩罚不足、奖励过度,且教师监督可靠性随轨迹结果与累积平均教师熵变化,于是提出 OG-OPSD:对正确轨迹全程用前向 KL、对错误轨迹仅在由累积平均教师熵最后一次交叉点确定的前缀内用反向 KL;在 Qwen3-1.7B/4B/8B 与 Qwen3-VL-2B 上,该方法在数学推理、多模态推理与分布外任务中一致优于 vanilla OPSD 与多个强基线。
(b) Qwen3-4B
arXiv深度剖析
把前向 KL 与反向 KL 的隐式 token 级优势与轨迹正确性联系起来:两者符号一致但系数幅度不同,FKL 对教师更看好的 token 给更大正优势且负惩罚有下界,RKL 对学生高估的 token 给无界负惩罚。 此前 vanilla OPSD 对所有轨迹和位置使用固定散度,近期工作多依赖 token 级统计或额外超参;这里改用二值验证器结果作为轨迹级选择依据。 基于 REINFORCE 形式的梯度推导(附录 A)给出式 6、式 7 与式 8 的隐式优势,并在消融中比较固定 FKL、固定 RKL 与反向配对,均出现性能下降。
识别出与结果相关的“前缀失败”模式:在错误轨迹上,教师补全准确率随截断前缀变长而明显下降,而在正确轨迹上保持稳定甚至提升。 把教师可靠性下降从 token 位置层面推进到轨迹结果层面,说明截断不应统一施加于所有轨迹。 在 OpenThoughts-Math30K、DeepScaleR、MATH-500、DeepMath 上采样 Qwen3 响应,按验证器结果分为正确/错误池,在不同截断长度下测量教师补全准确率(TCA),并在 Qwen3-1.7B 上观察到相同趋势。
提出 OG-OPSD:正确轨迹全程 FKL,错误轨迹仅在由正确与错误两组累积平均教师熵曲线最后一次交叉点确定的前缀内使用 RKL,且该截断点对错误轨迹共享。 相对 ESR 的统一截断、PW-OPSD 的位置加权、EOPD 的 token 级熵选散度,这里只用二值结果与累积平均熵两个信号,不引入额外超参数或权衡。 消融显示去掉截断、改为全轨迹截断或反转散度配对都会一致掉点;截断参数在相邻取值区间内性能相对稳定。
在 Qwen3-1.7B/4B/8B 上,OG-OPSD 在 AIME24、AIME25、HMMT25 三基准平均分分别为 44.4、64.9、66.4,均高于 vanilla OPSD 与所列基线;在 Qwen3-VL-2B 的 FinMME 及 MathVerse、MathVision、MMMUPro 上也取得所评估方法中的最高分。 增益随模型规模增大而扩大,且在数学后训练后 LiveCodeBench v5 的下降幅度小于 vanilla OPSD 与 PW-OPSD。 数学评测为 AIME24/AIME25/HMMT25 各 30 题、每题 12 个样本的 Avg@12;多模态为 FinMME 测试集与三个 OOD 基准;代码保持性用 LCB v5 衡量。
启示与展望
该结果面向具备可自动验证二值结果的任务设定,例如数学推理与多模态数学推理;方法在 Qwen3-1.7B/4B/8B Instruct 与 Qwen3-VL-2B-Instruct 上验证,训练数据为 OpenThoughts-Math30K(29,434 条)与 FinMME 子集,截断点由训练数据上正确与错误两组累积平均教师熵曲线的最后一次交叉确定并对错误轨迹共享。对希望降低自蒸馏噪声、又不想引入额外超参数的团队,这套“结果选散度、熵定位置”的规则可直接嵌入现有 OPSD 流程;作者提出未来可扩展到分级奖励与逐轨迹自适应截断。
教师补全准确率与累积平均熵曲线以图 1、图 4 呈现,正文未给出具体数值,因此截断点在不同数据分布下的取值需要读者自行复现确认;截断参数敏感性分析显示峰值附近相对稳定,但更大规模或非数学领域的适用区间仍待检验;作者提到受算力限制未能在 1.7B 与 8B 上比较全部基线,跨规模结论的完整对照仍有限;多模态与代码保持性结果来自单一 VL 模型与 LCB v5,其可迁移范围值得进一步观察。
