跳到主要内容
返回时间线
arXiv来源发表:

LSL用GMM门控把权重更新限制在当前数据支持域,使70亿参数LLM多阶段微调后仍保留96.6%预训练能力

相关研究与后续进展

核心概要

作者提出Local Support Learning(LSL),把灾难性遗忘视为每个权重矩阵输入空间的几何问题,用一个基于高斯混合模型的门控函数只在该阶段训练分布的支持域上启用权重适配器,从而在无法访问先前数据的情况下,对最多70亿参数的LLM进行多阶段微调,既充分学习新任务又保留预训练与先前微调能力。

AI-generated editorial illustration: Local Support Learning

深度剖析

论文从单个权重矩阵的输入—输出映射出发,指出梯度优化器产生的更新会作用于所有输入:只要先前输入与更新不正交,其logits就会被改变,因此这类更新在保留目标下是次优的;由此提出自然的保留目标——更新应只影响当前阶段分布的支持域。 此前工作或依赖先前数据缓冲区、数据相关正则化与正交约束,或只保护先前微调阶段、或从权重近似预训练数据的正交补;本文把遗忘重新表述为逐矩阵输入空间的支持域问题,并指出正交补近似不足。 以二维六类玩具分类问题复现灾难性遗忘,给出logits变化依赖点积的推导,并说明Adam与Muon仍产生作用于全部输入的矩阵更新;对正交补近似的不足在附录C中给出分析。

LSL在训练新阶段时并行使用两个组件:按常规最小化损失训练的权重适配器,以及估计当前数据在适配器输入空间支持域的门控函数;推理时门控只对落在该支持域内的token启用适配器。 与始终开启门控的标准微调、以及把更新限制在低秩或正交子空间的方法不同,LSL把局部性交给门控,使更新只在其训练分布附近生效。 给出训练与推理算法(Alg. 1、Alg. 2),并说明推理在prefill阶段可像标准MLP一样完全并行。

门控用高斯混合模型实现:对当前阶段分布拟合一个GMM,对一小份通用预训练数据样本拟合第二个GMM,按似然较大者判定输入归属,从而避免人工设定阈值;高斯密度随距离指数衰减,使门控天然倾向于对未见输入保持关闭。 论文给出理论联系:在worst-case测试分布下门控误差分解为deficit与excess,训练目标只优化deficit而对excess完全不可见,而密度估计器可在显式条件下恢复最优门控;输入相关阈值形式满足相应界。 附录E给出完整推导,包括局部估计器、密度估计、分类器三类假设族的对比与三个一维反例;经验上该门控在分布外预训练任务上约16%的token被打开(加时间平滑后5%),同时保留96.6%预训练性能(平滑后98.8%)。

在Qwen2.5-7B-Instruct上对网络安全指令微调、英语到伊博语低资源翻译、化学指令微调三个任务进行评测,LSL在新任务上达到强表现,同时在GSM8K、HumanEval、IFEval上保持接近最优的预训练能力保留;多阶段顺序微调中,LSL保留预训练能力且各微调任务在自身阶段结束后不被后续阶段覆盖。 LoRA在所有设置中都出现遗忘,OP-LoRA与LoRA接近(附录C显示更新能量大部分本就在正交子空间),LwF优于权重类方法但仍落后于LSL;LoRA基线在任务1后任务3零样本性能下降11%,任务1两阶段后下降8%,任务2一阶段后下降5%。 每个实验取三个随机种子平均,超参数按新任务验证性能选择、保留基准不参与选择;多阶段实验因运行时间长将各基准评测样本上限设为300。

启示与展望

该结果面向在无法访问先前数据、且每阶段内存受限的流式多阶段微调场景,适用于具备良好表征的预训练LLM;门控假设每阶段激活可由GMM刻画,因此更适用于表征质量较高的基座模型,规模实验显示更大模型保留更好。方法可与标准适配器微调流程结合,门控按模块独立拟合便于并行,且不要求参考数据与原始预训练数据相关,经验上不超过100万token即可。作者指出未来可扩展到更大模型、其他模态、强化学习目标以及数百个阶段,后者可能开启测试时训练,把新知识写入权重而非上下文。

理论动机针对单个权重矩阵,向多层网络的扩展由经验支持而非形式化证明;门控依赖基座模型表征质量,若某阶段激活无法被GMM良好刻画,保留效果可能受限。适配器无法合并进基座权重,推理成本随阶段数线性增长,虽然可并行化以计算换时间。门控在分布外预训练任务上仍会打开约16%的token(平滑后5%),说明支持域估计是实用近似而非精确阈值。多阶段实验将各基准评测样本上限设为300,且GMM拟合步骤在扩展到大规模微调数据时可能需要进一步加速。此外,本文为全文阅读,但图表以文字描述形式呈现,具体曲线数值需查阅原文图表。

来源