跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Latent-MOPD 让学生模型同时吸收多位专家的预测与隐藏状态,在数学、代码与逻辑九个基准上全面超过单通道基线

该工作提出 Latent-MOPD,一种面向大语言模型的多教师在线策略蒸馏方法,首次在表示层面整合多位专家:它按师生关系选择后层隐藏状态目标、用共享投影对齐不同隐藏宽度、按领域分组更新,并让每个教师的监督从隐藏状态逐渐转向词元预测;在同族设置下,它在数学、代码与逻辑的九个基准上均优于仅词元、仅表示与均匀平均基线,且在同参数量下于多数基准上超过各基准最佳教师;在跨族大教师设置下,它在所有基准上优于两种单通道基线。