跳到主要内容
返回时间线
arXiv来源发表:

Meituan LongCat 团队用教师参数邻域扰动把 Qwen3 数学推理平均分再提 1.67–2.75 分

核心概要

该工作提出 Neighborhood OPSD(N-OPSD):在 on-policy self-distillation 中,对带参考解答的教师做局部参数扰动得到一批冻结专家,离线按“超出当前专家池最优的过滤参考 token 增益”贪心挑选互补专家,在线用 MaxPeak 选锚 token、再用分位数规则在锚一致的专家中选监督强度,在 AIME 2024、AIME 2025、HMMT February 2025 三项基准的 Average@12 上,相对 OPSD 在 Qwen3-1.7B、4B、8B 上分别提升 2.75、1.67、1.94 分,且推理时只用蒸馏后的学生模型。

AI-generated editorial illustration: Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation

深度剖析

作者发现特权教师的参考对齐监督并不局限于未扰动的那一组参数:对教师参数做局部扰动得到的专家,会在不同参考位置上提供互补的纠正,其专家池覆盖的参考位置多于未扰动的 M0。 此前 OPSD 在每个学生访问状态都使用同一组固定教师参数,多教师蒸馏则多按领域、任务或任务准确率分配教师;这里把“同一参考上下文、不同邻近参数设置”作为监督多样性的来源。 在 500 道留出问题、σ = .002 的设定下,专家池覆盖 26.53% 的参考侧 SCGate 保留位置,M0 为 15.69%,且在每个测试半径上专家池覆盖都更高;覆盖要求至少一个专家给出正的过滤 PTA。

离线贪心选择按“超出当前池最优的过滤参考 token 增益”逐个加入专家,比随机选择、按解题准确率排序、按新解出题目覆盖排序、以及独立 PTA Top-K 都更好。 把专家选择从“谁更准”改为“谁给当前池补上尚未覆盖或更强的参考对齐纠正”,并显式处理池内纠正重叠。 在 Qwen3-8B、相同路由与门控下,完整方法 Average@12 为 66.57,独立 PTA Top-K 为 65.65,贪心样本覆盖为 65.37,Quality Top-K 为 65.00,随机 Top-K 为 64.29;作者称这些比较在三个基准上均显示增益。

在线路由把“方向”和“支持强度”分开:MaxPeak 取任一专家给出的最高概率 token 作为锚,再在 top token 与锚一致的专家中按分位数选择监督来源,学生仍学习该专家的完整下一 token 分布。 不同于平均专家分布、多数投票共识或直接选峰值最高的专家,该规则允许单个专家提出方向,同时避免因教师-学生概率差过大导致锚 token 的 forward-KL 项被裁剪。 同一专家池下,q = .75 的分位数路由比均匀平均高 1.94 分、比 token 共识高 1.57 分、比随机路由高 1.66 分;准确率从 q = 0 升到 q = .75 后在 q = 1 下降 1.29 分,说明峰值最高的专家不一定是最好的训练目标。

该监督来源的收益在更换散度与目标分布后仍然存在,且推理只需蒸馏后的单一学生模型。 把“扩大监督来源”与“改造散度或损失权重”区分开,说明路由后的目标可与 JSD、RKL 或压缩目标配合使用。 在池与路由固定的条件下,N-OPSD 在 JSD 与 RKL 下都优于 OPSD+SCGate;即使把目标压成 Top-1-tail 的二值软目标,仍比 OPSD+SCGate 高 2.12 分,完整词表目标比两种压缩变体分别高 1.30 和 1.20 分。

启示与展望

该结果面向用带参考解答的特权教师做数学推理 on-policy 自蒸馏的训练场景,适用于 Qwen3-1.7B、4B、8B 这一模型族与 AIME 2024、AIME 2025、HMMT February 2025 这类竞赛数学评测;作者给出的默认配置是 K = 25 个专家、路由分位数 q = .75、在线 SCGate 阈值 τ = .99、选择裁剪 κsel = κ = .06,各规模校准半径为 1.7B 的 .0006、4B 的 .0012、8B 的 .002。训练时专家池保持冻结,只有学生参数更新,推理时只部署蒸馏后的学生,因此下游使用者不需要在服务端保留任何扰动专家。作者也指出,离线选择基于参考前缀上的过滤 PTA,而在线路由发生在学生自己访问的状态上,因此这套流程可被理解为“先离线组队、再按状态选人”的两段式方案,后续可扩展到其他模型族与代码生成、多跳问答、工具使用等任务。

专家池在训练全程冻结,而学生参数持续变化,作者自己提出“对学生最有用的专家可能不同于离线选出的专家”,并建议未来研究周期性重算 PTA 与重选专家,同时权衡重复评估全部候选带来的算力开销。半径选择上,参考侧覆盖与锚准确率在更大半径下继续上升,但学生前缀续写准确率与下游平均分在 σ = .002 之后下降,说明参考侧指标不能直接当作学生监督质量的代理,作者因此主张用学生前缀续写来校准半径。池大小与最佳分位数也相互耦合:K = 25 时最佳测试分位数为 .75,K = 50 时变为 .50,且 K = 50 的最佳结果仍低于 K = 25。此外,本证据包为论文全文,但部分分析细节(如完整参考侧审计、续写探针的逐项结果)以附录表格形式给出,若只读正文,对这些中间量的判断仍需回到附录核对。

来源