跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

SF-MOPD 用快慢双模型解耦多教师蒸馏中的能力干扰,在多尺度模型上同时提升多模态专长并减少通用能力退化

该工作提出慢-快多教师在线策略蒸馏(SF-MOPD):用直接由各教师更新的快模型与作为学生指数滑动平均的慢模型配对,在 log 概率空间计算教师诱导更新并只移除把快模型推离慢模型的分量、保留对齐与正交分量;多模型尺度实验显示其缓解能力干扰、增强多模态专长并降低通用能力基准上的平均退化,稳定优于原始 MOPD。