DN-MOPD 按域归一化教师反馈,在 Qwen3.5 三个规模上把六任务均分从 MOPD 的 58.4/50.3/26.6 提升到 59.6/52.5/29.0
核心概要
该工作发现多教师在线策略蒸馏(MOPD)仅靠域标签路由无法让学生超过最强单教师学生、且几乎不迁移数学专家的增益,原因是各域反馈尺度失衡(首个训练批次中指令跟随的对数比离散度是池化信号的 2.3–4.4 倍、数学约为一半,初始 4B 学生中指令跟随损失贡献了 94% 的合并梯度),于是提出 DN-MOPD:保留标签路由,用每批次池化与各域对数比标准差的裁剪比值对每个域的蒸馏优势做缩放,在 Qwen3.5-9B/4B/2B 上于 8K 与 16K 两个评测预算、三个学生随机种子下均提升六任务均分(16K 提升 1.17–2.36 个百分点,8K 提升 2.47–3.08),并找回大部分丢失的数学增益。
深度剖析
仅靠教师分配不足以迁移专家能力:在 Qwen3.5-9B/4B/2B 上,标签路由的 MOPD 在任一规模都未超过最强单教师学生,且几乎不迁移数学专家的增益(8K 预算下仅保留 14–32%,16K 下相对初始化无增益)。 此前 MOPD 及其后续工作把注意力放在“哪个专家来教”(路由)或按 token 份额与剩余教师—学生差距手工设定权重,本文把“反馈强度”作为独立设计维度提出并量化其失衡。 三个独立训练的 Qwen3.5 专家池、每个规模共享专家与学生初始化、80 次更新、学生种子 42(另有两个种子),配对 95% 区间按问题重采样;反馈失衡由首个训练批次的对数比离散度与 4B 初始学生的逐域梯度测量支撑。
DN-MOPD 把每个教师的反馈放到共同尺度上:按每批次池化对数比标准差与各域对数比标准差的裁剪比值缩放该域的蒸馏优势,保留标签路由与每个优势的符号,MOPD 是所有乘子等于 1 的特例。 与按 token 份额或平均奖励幅度分配权重(如 Open-MOPD 的域预算与奖励刷新)不同,该规则针对的是离散度而非教师质量或剩余能力差距,且无需额外教师调用、额外教师模型或学习型路由器。 规则在论文第 2 节与附录 D.1 给出完整定义(总体标准差约定、裁剪边界、乘子为 1 的退化条件),并附参考实现与单元测试;实测乘子为数学约 1.5–2.1、代码在 4B/2B 接近 1、指令跟随多数批次落在 0.25 下界。
校准反馈尺度能稳定改进 MOPD:DN-MOPD 在每个规模、两个评测预算下都提升六任务均分,所有配对区间高于零,并在三个学生种子上保持优势;同时超过最强单教师学生,并找回 MOPD 丢失的大部分数学增益。 相对标签路由 MOPD,16K 提升 1.17–2.36 个百分点、8K 提升 2.47–3.08 个百分点;数学在每个规模、每个预算与每个训练终点都改善且区间高于零,而代码与指令跟随的差异较小且方向不一。 主比较固定专家、学生初始化、提示与更新预算;三个种子匹配比较的均值增益为 +1.12、+1.97、+2.34(16K),两层区间排除零;MATH-500 上 DN-MOPD 在每个规模与预算都领先标签路由且区间高于零。
增益主要来自压低指令跟随反馈,而非单独放大数学:固定域权重控制显示,只把指令跟随降到 0.25 就能在 4B/2B 找回大部分改进并把数学提高约 3 分,而只把数学放大到 2 的收益更小;接近 DN-MOPD 实测乘子的固定权重在 9B 与 4B 表现相当。 这解释了为什么“放大欠迁移的数学”这一直觉做法只找回约一半(4B)甚至很少(2B)的改进,并把反馈尺度校准与教师选择区分开来。 固定权重控制覆盖 9B/4B/2B 与两个评测预算,含更新 0 权重、全局 (2,1,0.25) 与单域控制;4B 初始学生的逐域梯度测量显示指令跟随在等权下占合并梯度的 94%,在 DN-MOPD 首批权重下降到 64%。
启示与展望
该结果面向在同一模型族内、由独立 RL 流程训练出的数学、代码与指令跟随专家池,把它们的反馈整合进一个共享学生;方法只需复用 rollout 打分已有的对数比,不增加教师调用、教师模型或学习型路由器,因此适合已有 MOPD 训练管线、希望在不改路由与数据配比的前提下调整反馈强度的团队。它适用于按域标签路由、每批次可统计域内对数比离散度的设置,并已在 Qwen3.5-9B/4B/2B 与 8K、16K 两个评测预算下验证;对 2B 规模,逐批次重估比一次性固定权重多带来约 1.10 个百分点的增益。
比较只覆盖每个规模一个专家池、一个模型族,三个学生种子并未覆盖重新训练专家;方法在早期 Qwen3 开发工具上选定,早期 Qwen3-4B 构造下未见明确增益,因此收益依赖教师—学生配置。尺度估计依赖域构成与回答长度,裁剪边界未按规模调优,指令跟随乘子多数批次停在下界,规则对该域是“限制”而非“完全拉平”。固定权重在 9B 与 4B 与 DN-MOPD 相当,逐批次重估只在 2B 额外带来增益。更长评测预算会缩小与标签路由的差距,160 次更新后各规模的最终收敛排序仍未确定;SeqKD-SFT 与任务算术在各自训练配方下保持更高的 Total。逐域梯度测量基于单一探针集、策略比为 1 且不含裁剪或优化器状态,属描述性分析。此外,本次载入的正文中若干附录表格的数值单元格为空,配对区间与部分逐域对比只能依据正文叙述,无法逐项核对具体数字。
