MOPD-Router 用 token 级路由取代领域标签硬路由,在无标签混合数据上把多教师蒸馏总分提高 5.88 分
核心概要
该工作提出 MOPD-Router,一个无需领域标签、也无需训练单独路由模型的多教师在线策略蒸馏框架,在每个 token 上对全部教师池进行选择与加权,并给出 ExpertAlign 这一以“教师相对共享预 RL 基座所获得的专长方向”与“其对当前学生的教学方向”之间正余弦对齐为评分依据的指标;在无标签与有标签两种训练混合、强到弱与同规模两种蒸馏场景共四个设置中,ExpertAlign 总体表现最佳,无标签数据上较 Mean 聚合提升 5.88 分(+12.3%),有标签数据上在不使用领域标签的情况下较标准 MOPD 提升 3.95 分(+7.8%)。
深度剖析
MOPD-Router 把多教师在线策略蒸馏中的教师分配从“每个 prompt 固定一个领域教师、贯穿整条 rollout”改为“每个 token 在完整教师池上按插件式指标打分并加权”。 既有 MOPD 实践依赖 prompt 级领域标签做硬路由,既限制无标签混合数据的使用,也放弃了其他教师在单个 token 上的互补信号;该框架不依赖领域标签,也不训练单独的路由模型。 论文给出采样 token 的 MOPD 形式化,将每教师优势按非负权重聚合,并说明标准 MOPD 与 Mean 聚合分别是该形式下的特例;实验覆盖无标签与有标签两种数据、强到弱与同规模两种蒸馏场景。
ExpertAlign 以教师相对共享预 RL 基座的策略位移定义其“专长向量”,再与教师对当前学生的“教学向量”做正余弦对齐,只保留正对齐的教师并按对齐强度加权。 Entropy 只看教师自身置信度,Novelty 只看教师—学生分布差异,二者都不判断该修正是否体现教师后训练所获得的专长;ExpertAlign 把“专长方向”与“教学方向”的一致性作为路由依据。 论文报告 ExpertAlign 在四个设置中总体得分均为最高:无标签数据上 1.7B 学生 38.58、4B 学生 53.76,有标签数据上 40.19 与 54.58;配对 bootstrap 检验显示其显著优于 Mean 聚合与标准 MOPD,并优于或匹配 Open-MOPD。
消融把 ExpertAlign 拆成“选哪些教师”与“如何加权”两步:正对齐门控(Uniform)在四个设置中把总体分较 Mean 聚合提高 1.22–4.75 分,余弦加权再在此基础上提高 1.62–3.34 分。 这一拆分说明对齐门控本身就能筛出更有效的教师子集,而对齐幅度还携带超出二值选择的额外路由信息。 论文以表格给出四个设置下 Mean 聚合、ExpertAlign-Uniform、ExpertAlign-Cosine 的分域与总体得分,并指出 Uniform 的增益集中在数学与代码,无标签数据上指令跟随略低。
跨领域教师提供互补监督,且这种价值在 token 级分配下才被充分捕获。 相对只保留领域标签所指教师的受限变体,恢复完整教师池使 1.7B 与 4B 学生总体分分别提高 2.40 与 2.75 分;在教师池相同的情况下,token 级路由又比整条回复级固定权重分别提高 3.62 与 1.97 分。 论文报告在数学、代码、指令跟随三类 prompt 上,所有非领域教师都获得超过 50% 的条件路由质量,并给出一个同时包含数学推理、Python 验证与 JSON 格式约束的案例,显示数学教师在数值推导、代码教师在 Python 计算、指令跟随教师在结构化输出处权重更高。
启示与展望
该框架面向的是多教师在线策略蒸馏这一具体后训练环节:教师由同一预 RL 基座经领域 RL 后训练得到,学生在其自身 rollout 上接受稠密 token 级监督。它使无标签的 SFT 与对话混合数据可以直接用于多教师蒸馏,无需先做教师分配标注;对有标签数据,它也能在不读取标签的情况下达到或超过标签硬路由。受益者是需要把数学、代码、指令跟随等专长合并进单一策略模型的后训练团队,以及希望在同一 MOPD 流程内比较不同路由指标的研究者。论文开源了框架代码,并把插件式接口定位为可继续接入验证器反馈或奖励等外部信号的试验台。
论文自身把结论限定在同族 Qwen3 教师、共享预 RL 基座、两种数据制度与两种蒸馏场景之内,更大教师池与由不同基座构建的教师仍属开放方向;作者也说明路由指标来自经验直觉而非统一设计框架。ExpertAlign 需要额外前向共享基座并计算 top-k 分布统计,论文测得同规模有标签设置下 GPU 小时数增加 3.5%,且该测量不含初始化、模型下载、验证与检查点 I/O。此外,ExpertAlign 的 top-k 支持集大小存在一个平台区间,K=32 时因尾部近零概率 token 的 log 比值放大而三个领域均下降;被完全过滤(无教师保留)的 token 比例虽低,但随训练呈轻微上升趋势,论文以几何解释给出描述性说明。附录中的置信区间表与三随机种子表在本次载入的文本中未给出具体数值,因此这些不确定性的量化幅度只能以正文所述范围为准。
