arXiv 2026年10月2日该研究以Qwen3-1.7B和四个同源RL教师(数学、代码、指令跟随、科学)做多教师在线策略蒸馏,比较梯度、优化器更新与任务学习曲线,并用SmolLM3-3B做诊断:损失平均隐含地给长回答更大权重,Adam一阶动量使不同教师的更新方向趋同(教师间余弦0.83、平均规则间0.96),BF16舍入掩盖了约97%的FP32主权重变化而只显示7–11%的BF16权重变化,top-64交集KL梯度与全词表梯度高度一致,但其数学准确率在回答平均下比采样token策略梯度高2.6分、在全局token平均下低2.1分。该研究以Qwen3-1.7B和四个同源RL教师(数学、代码、指令跟随、科学)做多教师在线策略蒸馏,比较梯度、优化器更新与任务学习曲线,并用SmolLM3-3B做诊断:损失平均隐含地给长回答更大权重,Adam一阶动量使不同教师的更新方向趋同(教师间余弦0.83、平均规则间0.96),BF16舍入掩盖了约97%的FP32主权重变化而只显示7–11%的BF16权重变化,top-64交集KL梯度与全词表梯度高度一致,但其数学准确率在回答平均下比采样token策略梯度高2.6分、在全局token平均下低2.1分。多教师在线蒸馏中,损失平均与Adam动量决定学生能力整合,top-64梯度逼近并不保证任务提升该研究以Qwen3-1.7B和四个同源RL教师(数学、代码、指令跟随、科学)做多教师在线策略蒸馏,比较梯度、优化器更新与任务学习曲线,并用SmolLM3-3B做诊断:损失平均隐含地给长回答更大权重,Adam一阶动量使不同教师的更新方向趋同(教师间余弦0.83、平均规则间0.96),BF16舍入掩盖了约97%的FP32主权重变化而只显示7–11%的BF16权重变化,top-64交集KL梯度与全词表梯度高度一致,但其数学准确率在回答平均下比采样token策略梯度高2.6分、在全局token平均下低2.1分。该研究以Qwen3-1.7B和四个同源RL教师(数学、代码、指令跟随、科学)做多教师在线策略蒸馏,比较梯度、优化器更新与任务学习曲线,并用SmolLM3-3B做诊断:损失平均隐含地给长回答更大权重,Adam一阶动量使不同教师的更新方向趋同(教师间余弦0.83、平均规则间0.96),BF16舍入掩盖了约97%的FP32主权重变化而只显示7–11%的BF16权重变化,top-64交集KL梯度与全词表梯度高度一致,但其数学准确率在回答平均下比采样token策略梯度高2.6分、在全局token平均下低2.1分。