跳到主要内容
返回时间线
arXiv来源发表:

SF-MOPD 用快慢双模型解耦多教师蒸馏中的能力干扰,在多尺度模型上同时提升多模态专长并减少通用能力退化

相关研究与后续进展

核心概要

该工作提出慢-快多教师在线策略蒸馏(SF-MOPD):用直接由各教师更新的快模型与作为学生指数滑动平均的慢模型配对,在 log 概率空间计算教师诱导更新并只移除把快模型推离慢模型的分量、保留对齐与正交分量;多模型尺度实验显示其缓解能力干扰、增强多模态专长并降低通用能力基准上的平均退化,稳定优于原始 MOPD。

Source-provided article image: Slow-Fast Multi-Teacher On-Policy Distillation for Capability Preservation
Figure 1 ·

Figure 1 : Comparison of capability absorption by MOPD and SF-MOPD across 11 benchmarks, with scores normalized separately for each dataset. The green line denotes the per-benchmark oracle reference obtained from the corresponding expert. SF-MOPD approaches the oracle reference on most benchmarks while better preserving general capabilities.

arXiv

深度剖析

论文指出多教师在线策略蒸馏(MOPD)在把领域专长整合进单一学生模型时,训练会逐步把学生推离其初始化模型,位移越大通用能力下降越明显,形成能力干扰。 此前 MOPD 被描述为整合领域专长的有效框架,但能力干扰这一副作用被明确命名为需要处理的问题,而非仅作为训练细节。 该判断来自摘要中对 MOPD 训练动态的陈述,属于问题设定层面的论证,未在摘要中给出量化曲线。

论文提出 SF-MOPD:快模型是当前学生、由每个教师直接更新;慢模型是学生的指数滑动平均,逐步吸收学习信号,充当融合通用基础与已确认领域专长的移动能力参考。 相对直接约束学生靠近初始化的做法,慢模型不是固定锚点而是随训练演化的参考,从而在保留专长获取的同时提供约束。 方法描述来自摘要,包含快慢模型定义与慢模型作为指数滑动平均的机制,摘要未给出具体超参数或更新公式。

对每个教师,SF-MOPD 在 log 概率空间计算教师诱导更新,只移除把快模型进一步推离慢模型的分量,保留对齐与正交分量。 把能力保持转化为对更新方向的分解与选择性剔除,而不是整体抑制学生偏离初始化。 摘要明确给出该分解与保留规则,但未提供消融或分量贡献的数值。

跨多个模型尺度的实验显示,SF-MOPD 缓解能力干扰、增强专门多模态能力,并降低通用能力基准上的平均退化,一致优于原始 MOPD。 相对原始 MOPD,报告的是专长与通用能力同时改善的方向性结果,而非以牺牲一方换取另一方。 证据来自摘要所述多尺度实验与基准比较,摘要未列出具体基准名称、模型规模或数值。

启示与展望

该工作面向把多个领域教师整合进单一学生模型的多教师在线策略蒸馏场景,适用于希望同时保留通用基础能力与领域专长的多模态大模型训练流程。其机制依赖快模型与慢模型的配对以及 log 概率空间中的方向分解,因此对采用类似在线策略蒸馏范式的团队最直接可用;摘要所述多模型尺度实验提示该思路在不同规模下均可尝试。

摘要未说明具体基准、模型规模、教师数量与训练成本,也未给出慢模型更新速率的取值影响;能力干扰的缓解幅度与专长提升幅度之间的权衡仍需在正文实验中确认。此外,本次仅基于摘要进行总结,未读取正文、图表与附录,因此上述机制细节与实验结论的完整证据链属于待核实的开放问题。

来源