PMOPD用参数更新子空间投影缓解多教师蒸馏的能力跷跷板,在Qwen2.5-7B与Llama-3.1-8B上把三任务均分分别提高2.54和2.09分
核心概要
该工作提出PMOPD,从已完成任务块的累积参数位移中构建逐矩阵的低维子空间记忆,并对后续任务的梯度与Adafactor优化器更新做双重投影以去除与受保护任务方向冲突的分量,同时用轻量冲突探针确定任务顺序、用子空间一致性选择循环次数;在Code、Reason、Math三个任务上,PMOPD在Qwen2.5-7B和Llama-3.1-8B上均优于MOPD,三任务平均分分别提升2.54分和2.09分,且每个单项任务都有提升。
深度剖析
论文从更新几何角度刻画了多教师在线策略蒸馏(MOPD)中的跨任务干扰:不同任务的累积参数位移会迅速集中到各自低维子空间,同任务内部一致、跨任务重叠很低。 以往OPD研究多聚焦单任务的目标设计、蒸馏范围与教师信号构造,而这里把MOPD的能力跷跷板问题转化为可度量的子空间重叠问题。 文中报告,训练进行到20%时提取的子空间与其最终子空间平均相似度已达0.62;Math、Code、Reason三者top-16更新子空间之间的相似度在0.133至0.151之间。
PMOPD用已完成任务块的累积位移构建逐矩阵子空间记忆,并对后续任务的梯度与预条件后的优化器更新同时做投影,移除与受保护方向对齐的分量。 与PCGrad等作用于瞬时梯度的多任务方法不同,PMOPD保护的是包含梯度裁剪与自适应优化效果的已实现块位移;文中指出仅投影梯度不够,因为Adafactor的逐元素自适应预条件会把已投影梯度重新转回受保护子空间。 消融实验在相同任务顺序、四个循环与相同数据预算下比较:无投影平均63.85,加入梯度投影升至66.22,再加入优化器更新投影升至66.97,完整流程比无投影高3.12分。
论文提出轻量冲突探针与循环策略来组织任务更新:用双向冲突测量排序任务,用同任务跨循环子空间相似度选择循环次数。 这把任务顺序与循环次数这两个原本需要穷举搜索的调度选择,转为训练前即可完成的低成本几何诊断。 六个任务顺序的平均分跨度达2.97分,CodeReasonMath取得最高平均65.81;十个各含60个样本的折均复现Code→Reason→Math排序,均值分别为28.04%、35.75%、36.97%;循环数扫描中四循环取得最高平均66.97与最高跨循环相似度0.525。
在两个模型家族、三个能力域上,PMOPD相对MOPD在每一项评测能力上都取得提升,而非在任务间重新分配性能。 结果同时覆盖Qwen2.5-7B与Llama-3.1-8B,说明该几何感知优化规则不局限于单一模型配置。 Qwen2.5-7B上平均66.97,比MOPD高2.54分、比BB-MOPD高3.08分;Llama-3.1-8B上平均41.04,比MOPD高2.09分、比BB-MOPD高4.75分;PMOPD结果为三次不同随机种子的平均。
启示与展望
该结果面向以共享参数整合多个领域教师的在线策略蒸馏后训练场景,适用于从同一基座检查点经领域强化学习得到的教师,并在Math、Reason、Code三类任务与Qwen2.5-7B、Llama-3.1-8B两个模型家族上验证。方法按每个二维可训练参数矩阵独立构建子空间记忆,每个循环从空状态重建,因此保护几何跟随当前轨迹而不累积无界存档。对希望在不做穷举排列搜索的前提下安排任务顺序与循环次数的实践者,冲突探针与跨循环子空间相似度提供了训练前的选择依据。
任务顺序与循环次数的结论建立在三个任务、两个模型家族与特定数据规模之上,任务数或训练规模扩大后冲突排序与最优循环数是否保持,仍是开放问题。冲突探针在每折60个样本下稳定复现排序,但探针样本量对排序稳定性的影响未在文中展开。四循环在平均分与跨循环相似度上同时达到峰值,这一对应关系支持了机制解释,但两者之间的因果链条仍需更多设置检验。此外,本次读取为全文,附录中的逐任务相似度与方向性冲突测量已包含在证据中,未见的补充材料可能还有进一步细节。
