SMAT把合并操作拆成Scale、Mask、Perturb三类模拟,在四个骨干上把五种合并方法的平均分提高1.07–2.16分,训练开销不到2%
核心概要
该工作提出SMAT(Simple MAT),从单个专家视角把常见模型合并方法归纳为Scale(重加权自身更新)、Mask(删除选定坐标)与Perturb(加入其他专家的更新)三种操作,在训练中采样缩放系数、掩码与加性噪声来模拟合并后的参数并联合优化专家损失与模拟合并损失,配合周期调度、算子融合与参数存储切换实现每步一次前向一次反向;在Llama-3.2-1B-Instruct、Llama-3.1-8B-Instruct、CLIP ViT-B/32与ViT-L/14四个骨干上,SMAT相对各骨干最强基线把五种合并方法的平均分提高1.07–2.16分,训练时间开销相对标准微调低于2%。
深度剖析
论文把Task Arithmetic、TIES-Merging、DARE、DELLA等常见合并方法从单个专家的角度统一描述为三种操作:Scale重加权该专家自身的更新,Mask删除选定坐标,Perturb加入其他专家的更新;据此SMAT在独立训练中采样缩放系数、掩码与加性噪声,构造模拟合并参数并联合优化专家损失与模拟合并损失。 此前的合并感知训练方法(SAFT、MergOPT、OrthoReg)没有完整覆盖常见合并操作,尤其是对专家自身更新的缩放与掩码;SMAT把这三类操作显式纳入训练目标。 论文给出式(1)的统一形式并说明其覆盖Model Soups、Fisher Merging、Task Arithmetic以及TIES、DARE、DELLA的掩码;消融显示去掉Scale、Mask、Perturb分别使五种合并平均分下降1.25、1.07、2.10分,三者均有贡献,Perturb影响最大。
SMAT在四个骨干上一致提升合并后性能:Llama-3.2-1B-Instruct平均分45.77、Llama-3.1-8B-Instruct 58.49,分别比最强基线OrthoReg高1.12和1.07分;CLIP ViT-B/32为74.46(比MergOPT高1.89分),ViT-L/14为87.78(比OrthoReg高2.16分)。 相对每个骨干各自的最强基线,SMAT在五种合并方法(WA、TA、TIES、DARE、DELLA)的平均分上取得1.07–2.16分提升,并在1B上领先五个合并列中的三个、8B与两个CLIP骨干上领先全部五列。 实验覆盖151M到8B参数的语言与视觉语言模型,每个模型用三种随机种子训练与评估并报告平均;语言任务使用TRACE的七个任务,视觉使用Cars、DTD、EuroSAT、GTSRB、MNIST、RESISC45、SUN397、SVHN,各方法共享数据、初始化、学习率、批大小与训练预算。
通过周期调度、算子融合与参数存储切换,SMAT每步只需一次前向和一次反向;在四个骨干上训练时间开销约为标准微调的0.2–1.9%,峰值GPU显存增加1.7–24.3%。 论文用命题1说明混合损失更新可在一阶意义上由按权重分配的单损失步替代,从而支持每四步一次模拟损失更新的周期调度;相比ASAM、MergOPT、OrthoReg的额外梯度评估、扰动处理或矩阵正则化,SMAT把开销压到接近标准微调。 表1、表2给出时间与显存相对FT的变化;附录E给出绝对训练时间,例如Llama-1B每步均值FT为0.0687秒、SMAT为0.0700秒,Llama-8B为0.3543对0.3594秒;Llama-1B上SMAT比OrthoReg提升1.12分同时训练时间少82%。
机制分析显示SMAT沿合并相关方向拓宽了低损失区域:在重缩放自身更新与加入其他任务更新两个方向上,SMAT在六个任务上的低损失区间比FT和MergOPT更宽,与Perturb对条件训练损失的平滑解释一致;此外SMAT在Muon优化器下平均分44.15,比OrthoReg高0.74分、比FT高5.90分,训练时间与FT相当。 论文把合并鲁棒性归因于损失平滑,并给出模拟状态矩与局部损失展开的理论刻画;同时验证增益不限于AdamW,并可通过对FT专家集的部分替换提升既有专家集合的合并表现(全FT归一化77.55%提升到全SMAT的86.08%)。 损失曲线基于表1的FT、MergOPT、SMAT专家集与相同FT伙伴更新和评估样本;Muon结果在Llama-1B上报告,SMAT专家分55.07接近FT的55.31;专家数实验显示SMAT归一化分数从两个专家的93.20%降到七个专家的86.08%,且专家越多优势越明显。
启示与展望
该结果面向共享预训练初始化、共享可训练参数并独立训练的专家集合,适用于语言与视觉语言骨干上的多任务合并场景;对希望在不联合重训的前提下提升合并后平均性能、且对训练时间与显存增量敏感的实践者,SMAT提供了一种可直接接入现有微调流程的训练方式,并可与WA、TA、TIES、DARE、DELLA等合并方法配合使用。论文还显示可通过部分替换把既有FT专家集升级为SMAT专家集,并可在Muon优化器下使用。
论文假设专家共享架构与初始化,异构模型、不同初始化以及联合计算、显存与检查点访问预算下的表现仍待评估;模拟合并损失与真实合并分布之间的差距由状态均值与二阶矩的差异刻画,论文明确指出该期望损失比较并不保证更高的任务分数;Perturb使用随机噪声近似其他专家的更新,均匀、高斯与拉普拉斯噪声在匹配RMS下趋势相近,精确分布匹配的作用尚不清楚;此外8B骨干上SMAT的独立专家分低于FT,说明更好的合并性能未必伴随更好的单专家性能,这一权衡在部署决策中仍需关注。
