多教师在线蒸馏中,损失平均与Adam动量决定学生能力整合,top-64梯度逼近并不保证任务提升
相关研究与后续进展核心概要
该研究以Qwen3-1.7B和四个同源RL教师(数学、代码、指令跟随、科学)做多教师在线策略蒸馏,比较梯度、优化器更新与任务学习曲线,并用SmolLM3-3B做诊断:损失平均隐含地给长回答更大权重,Adam一阶动量使不同教师的更新方向趋同(教师间余弦0.83、平均规则间0.96),BF16舍入掩盖了约97%的FP32主权重变化而只显示7–11%的BF16权重变化,top-64交集KL梯度与全词表梯度高度一致,但其数学准确率在回答平均下比采样token策略梯度高2.6分、在全局token平均下低2.1分。
深度剖析
损失平均规则本身就是一种隐式的回答与领域加权:全局token平均按token份额分配领域权重,领域token平均固定领域权重但仍按长度加权回答,领域回答平均才使回答等权。 作者用协方差恒等式把领域token平均的域内梯度写成无权重领域梯度加上长度与逐回答梯度的协方差项,说明Open-MOPD的token份额校正只恢复领域token平均、仍保留域内长度加权。 在固定学生参数、相同回答上比较领域token与领域回答平均,六个批次的平均梯度余弦为0.68;协方差恒等式在FP64下对全部24个批次-领域组验证,最大相对残差极小。
Adam的一阶动量使不同教师损失产生的参数更新方向高度一致,即使当前梯度近乎正交;BF16舍入则把广泛的FP32参数变化显示为稀疏变化。 作者把当前监督信号与优化器历史分离:教师间更新余弦超过0.83,但重置一阶动量或使用等范数SGD后降到接近零;在域内输入上,扣除零梯度基线后的更新余弦低于0.01,共享输入时升至约0.24–0.35。 在保存的Adam状态上做单步更新比较;域回答平均下约97%的FP32主权重相对初始化发生变化,舍入到BF16后为7–9%(含领域token与全局token平均为7–11%),FP32中约三分之一参数贡献90%的平方变化量,BF16中约4%。
更接近全词表梯度的词表截断并不稳定地带来任务提升,其效果取决于平均规则。 top-64交集KL在Qwen中保留超过99.9%的学生概率、梯度方向与全词表KL几乎一致,但相对采样token策略梯度的数学准确率在回答平均下高2.6分、在全局token平均下低2.1分,说明梯度保真度不能预测任务层面的得失。 在相同前缀与Adam状态下比较PG、top-64交集、教师top-64与全词表KL;每前缀采样1、16、64个样本时PG梯度对全词表KL的余弦从0.54升到0.87和0.97,top-64超过0.999;SmolLM3-3B上top-64平均保留97.42%(训练后98.56%)学生概率,但分别有8.42%和3.65%的加权前缀保留不足90%。
在PG损失下,无动量的SGD在三种平均规则上都取得比Adam更高的四任务平均分。 作者把这一结果与动量可能保留早期回答所偏好的方向、延迟对当前监督的适应联系起来,并指出需要进一步检验更小的Adam或梯度裁剪与二阶归一化能否解释相似期望梯度的损失为何产生不同任务结果。 完整训练500步、PG损失下,领域回答平均39.94对38.91、领域token平均39.46对38.63、全局token平均39.26对38.79;三种平均规则下Adam的均值差距为0.28个百分点,top-64交集KL下为0.06个百分点。
启示与展望
该工作面向使用同源RL教师做多教师在线策略蒸馏的后训练实践者,适用于Qwen3-1.7B这一规模与四个领域教师(数学、代码、指令跟随、科学)的设置,并在SmolLM3-3B上做补充诊断。它给出的是在固定学生参数、固定回答与保存优化器状态下的对照测量,以及500步训练的任务曲线,因此可直接用于指导回答加权规则、词表候选预算与优化器(Adam对无动量SGD)的联合选择,并提示在评估参数变化时应同时报告FP32主权重与BF16权重的统计。
结论基于有限模型家族与规模,作者指出更大规模下观察可能不同;更小的Adam、梯度裁剪与二阶归一化能否解释相似期望梯度的损失产生不同任务结果,仍是开放问题。SmolLM3诊断显示平均覆盖率很高时仍存在低覆盖前缀与最高达24.54%的相对梯度误差,这类长尾前缀在更大词表或更分散预测下如何影响训练值得继续观察。此外,本总结依据的是论文正文与附录文本,未包含图表原图,个别数值的图形细节无法在此核对。
