LMOPD 用词典序多教师蒸馏,在 30B-A3B 模型上以约 90% 保留率守住最高优先级能力
相关研究与后续进展核心概要
该工作提出词典序多目标在线策略蒸馏(LMOPD),按显式优先级为每个学生 rollout 选择首个被门控判定为不足的奖励专家,并把其中心化对数策略修正投影以去除与更高优先级专家相冲突的分量,在 30B-A3B 混合专家模型的三项数学基准上,两专家设置下点估计完整保留准确率与推理质量增益并取得 46.9% 的简洁性增益,四专家设置下保留约 90% 的准确率增益与推理正确性增益,而所评估的次优基线仅约 57%。
Figure 1: LMOPD overview. (a) We train reward-specialized experts and assign each reward to an expert; one expert may serve multiple rewards. (b) Each student rollout is checked in that order and routed to the first objective whose gate detects a deficiency; a rollout that passes every gate is self-distilled. (c) At each token, LMOPD removes only components of the routed specialist’s correction that oppose earlier specialists, producing a projected virtual-teacher target.
arXiv深度剖析
提出 LMOPD:一种在显式优先级下整合奖励专精策略的多教师方法,对每个学生 rollout 选择第一个目标上被门控判定为不足的专家,并对其中心化对数策略修正做局部投影,移除与更高优先级专家相对抗的分量。 已有多种奖励后训练方法通常对奖励做标量化,或直接组合专家,而不显式保护奖励优先级顺序;LMOPD 把优先级顺序作为整合机制的核心,而非事后加权。 方法描述来自摘要,并在四专家匹配消融中显示词典序路由优于随机路由、投影进一步强化两个最高优先级能力。
在 30B-A3B 混合专家 transformer 上,两专家设置下 LMOPD 的点估计完整保留准确率与推理质量增益,同时获得 46.9% 的简洁性增益。 说明在非对称权衡下,简洁性可以在不牺牲更高优先级正确性的前提下被部分获取,而不是以正确性换取简洁。 基于三项数学基准上的保留增益测量,报告为点估计。
四专家设置下 LMOPD 保留约 90% 的准确率增益与推理正确性增益,而所评估的次优基线仅约 57%。 在专家数量增加、目标冲突更复杂时,显式优先级带来的保留优势相对基线更为明显。 三项数学基准上的保留增益对比,基线为作者所评估的现有方法。
匹配的四专家消融表明,词典序路由优于随机路由,且投影步骤进一步强化两个最高优先级能力。 把整体收益拆解到路由与投影两个组件,分别给出其独立贡献方向。 匹配条件下的四专家消融实验。
启示与展望
该结果面向需要在多个奖励目标间保持明确优先级的后训练场景,尤其是正确性、推理质量与简洁性存在非对称权衡时。方法适用于多教师、奖励专精策略的整合,并在 30B-A3B 混合专家 transformer 与三项数学基准上验证;两专家与四专家设置分别给出保留增益的量化结果。对希望在不牺牲最高优先级能力的前提下获取次级目标收益的工程实践,LMOPD 提供了可复用的路由加投影思路。
当前证据来自摘要层面的描述,未包含基准名称、评测细节、训练成本与统计不确定性信息,因此保留增益的稳健性、点估计之外的方差,以及在其他任务与模型规模上的表现仍是开放问题。四专家消融中路由与投影各自的贡献幅度、以及优先级顺序变化时结果如何变化,也需要在原文中进一步确认。
