跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

LMOPD 用词典序多教师蒸馏,在 30B-A3B 模型上以约 90% 保留率守住最高优先级能力

该工作提出词典序多目标在线策略蒸馏(LMOPD),按显式优先级为每个学生 rollout 选择首个被门控判定为不足的奖励专家,并把其中心化对数策略修正投影以去除与更高优先级专家相冲突的分量,在 30B-A3B 混合专家模型的三项数学基准上,两专家设置下点估计完整保留准确率与推理质量增益并取得 46.9% 的简洁性增益,四专家设置下保留约 90% 的准确率增益与推理正确性增益,而所评估的次优基线仅约 57%。