Latent-MOPD 让学生模型同时吸收多位专家的预测与隐藏状态,在数学、代码与逻辑九个基准上全面超过单通道基线
相关研究与后续进展核心概要
该工作提出 Latent-MOPD,一种面向大语言模型的多教师在线策略蒸馏方法,首次在表示层面整合多位专家:它按师生关系选择后层隐藏状态目标、用共享投影对齐不同隐藏宽度、按领域分组更新,并让每个教师的监督从隐藏状态逐渐转向词元预测;在同族设置下,它在数学、代码与逻辑的九个基准上均优于仅词元、仅表示与均匀平均基线,且在同参数量下于多数基准上超过各基准最佳教师;在跨族大教师设置下,它在所有基准上优于两种单通道基线。
Figure 1: Same-family gains beyond individual teachers, with a cross-family extension. (a) Same-family; (b) cross-family (last 1, Linear). Both panels use shared per-axis scales, with each outer vertex fixed at the same-family Latent-MOPD score. Solid polygons show Latent-MOPD; the dotted ring in (b) repeats the same-family reference. Representation-only denotes OPRD-style (all layers) in (a) and Rep-only (last 1) in (b) . Labels give Latent-MOPD scores; bold with ( > > Teacher) marks those above the strongest teacher. Table 1 reports all nine same-family benchmarks.
arXiv深度剖析
提出 Latent-MOPD,据作者所知是首个面向大语言模型的表示层面多教师在线策略蒸馏方法,同时利用专家的预测分布与产生这些预测的隐藏状态来整合多位专家,且不需要额外训练教师。 此前的多教师在线策略蒸馏只迁移专家预测的输出分布,本工作把监督信号扩展到内部隐藏状态,从而在同一学生中同时利用两类信息。 摘要给出方法层面的定位与设计描述,并以同族与跨族两组实验作为支撑。
为协调多位专家的表示监督,方法采用三项机制:按师生关系选择后层目标、用共享投影桥接不等的隐藏宽度、按领域分组更新;每个教师的监督从隐藏状态逐渐转向词元预测,两条通道使用同一个被路由的专家。 这些机制针对多教师表示监督中的层级选择、宽度不匹配与领域混杂问题给出具体处理方式,而非简单平均多位教师的信号。 摘要以设计说明形式列出上述机制,并指出两条通道共享同一路由专家。
在同族主设置下,Latent-MOPD 在数学、代码与逻辑的九个基准上均优于仅词元、仅表示与均匀平均三种基线;在与每个教师参数量相同的情况下,学生在其中多数基准上还超过了各基准上的最佳教师。 相对既有单通道与均匀平均做法,该方法在全部九个基准上取得优势,并显示出学生可超过单个专家教师的表现。 摘要报告了九个基准上的对比结果,并说明学生参数量与各教师相同。
在规模更大、独立开发的跨族教师设置下,Latent-MOPD 在所有基准上优于两种单通道基线;同族全层仅表示对照在领域纯净更新时保持稳定,但当教师领域在一次更新内交错时出现崩溃。 跨族结果说明该方法不限于同族教师;对照实验则揭示领域交错会显著影响仅表示监督的稳定性。 摘要给出跨族全部基准的对比结论,以及同族全层仅表示对照在两种更新组织方式下的稳定性差异。
启示与展望
该工作面向大语言模型的多教师在线策略蒸馏场景,适用于能够访问专家隐藏状态、并可按师生关系选择监督层级的设置。摘要显示其价值在于:同族设置下在数学、代码与逻辑九个基准上全面优于仅词元、仅表示与均匀平均基线,同参数量下在多数基准上超过各基准最佳教师;跨族设置下在所有基准上优于两种单通道基线。因此它主要服务于希望用单一学生模型整合多位领域专家能力的研究与工程实践,尤其是教师与学生同族或教师规模更大、独立开发的两种情形。摘要未给出具体基准名称、模型规模、训练数据与超参数,实际复现需以原文与随附代码为准。
摘要未列出九个基准的具体名称、教师与学生的模型规模、训练数据构成与超参数设置,也未给出各基准上的具体数值与效应大小,因此难以判断优势幅度。同族全层仅表示对照在领域交错更新下崩溃,提示更新组织方式对表示监督稳定性有影响,但其机制与适用范围仍需在原文中确认。跨族结果仅说明优于两种单通道基线,未说明与各跨族教师单独表现的比较。以上均为摘要层面的信息边界,具体结论应以原文正文、图表与随附材料为准。
