跳到主要内容
返回时间线
arXiv来源发表:

AMD 用双模型互蒸馏与逐任务权重选择,在六个基准和三个骨干上超过多任务 SFT,合并后平均提升 2.91 分

相关研究与后续进展

核心概要

该工作提出自适应互蒸馏(AMD),联合训练两个采用不同任务平衡策略的模型,通过跨任务共享的短训练探针评估蒸馏权重的候选调整,并用逐任务验证分数为每个任务和迁移方向选择调整,在六个基准和三个 LLM 骨干上两个 AMD 模型均高于同采样策略的 SFT 基线并优于所评估的任务平衡方法,合并两模型可进一步提升平均基准分数并得到单一推理模型,合并模型在三个骨干上平均超过多任务 SFT 2.91 分。

Source-provided article image: Adaptive Mutual Distillation for Balanced Multi-Task Post-Training of Large Language Models
Figure 1 ·

Figure 1: Overview of AMD . Two models with different task-balancing strategies undergo independent SFT warmup, followed by mutual distillation with task- and direction-specific weights adjusted using validation feedback. The trained models can optionally be merged into a single model for inference after collaborative training concludes.

arXiv

深度剖析

提出自适应互蒸馏(AMD),一个协同后训练框架,同时训练两个使用不同任务平衡策略的模型,使二者互相提供跨模型监督。 既有方法主要关注单模型训练中的任务贡献平衡;AMD 把不同平衡策略产生的互补优势转化为双向蒸馏信号,把平衡问题从单模型内部扩展到模型之间。 摘要层面给出框架设计:联合训练两个模型、以短训练探针评估候选蒸馏权重调整、以逐任务验证分数为每个任务与迁移方向选择调整;未在文本中给出探针长度、权重搜索空间或训练步数等细节。

AMD 在两个模型上均取得高于同采样策略 SFT 基线的平均基准分数,并优于实验中所评估的任务平衡方法。 相对单模型任务平衡方法,AMD 的增益来自跨模型、逐任务、逐方向的权重自适应,而非仅调整采样比例。 覆盖六个基准与三个 LLM 骨干;文本给出的是平均基准分数比较,未列出逐基准数值、方差或显著性检验。

合并两个已训练模型可进一步提升平均基准分数,同时得到用于推理的单一模型;合并模型在三个骨干上平均超过多任务 SFT 2.91 分。 把互蒸馏的收益从“两个模型各自更好”延伸到“合并后单模型更好”,降低了部署两个模型的开销。 文本明确给出 2.91 分的平均差距与三个骨干的范围;合并方式、权重插值或集成细节未在文本中说明。

启示与展望

该工作面向多任务后训练场景,适用于任务训练数据量不均、且可以同时训练两个采用不同任务平衡策略的模型的情形;其收益以六个基准和三个 LLM 骨干上的平均基准分数衡量,合并模型则面向需要单一模型推理的部署设置。对希望减少任务间不平衡、又愿意承担双模型训练与探针评估开销的研究者与工程团队,AMD 提供了一条把互补优势转化为蒸馏信号的路径。

文本为摘要级信息,未给出逐基准分数、方差或显著性检验,因此 2.91 分的平均提升在不同任务上的分布仍待观察;短训练探针的长度、候选调整的搜索方式、蒸馏权重的更新频率,以及两模型合并的具体做法(如权重插值或参数平均)均未在文本中说明;不同任务平衡策略组合、骨干规模与任务数量变化时,逐任务验证分数选择是否仍然稳定,是值得进一步关注的问题。

来源