把Adam二阶矩仅对输出投影调高,在160M至12B的八个设置中消除39.4%–67.9%的灾难性遗忘
核心概要
作者在无原始数据的持续预训练与微调中,通过逐组冻结把灾难性遗忘定位到新语料中罕见词的输出嵌入行,并指出这些行因持续单向的softmax梯度被Adam的二阶矩归一化放大成全尺寸更新;据此仅在输出投影上调高Adam的二阶矩,在160M至12B、四个模型家族的八个设置中于七个稳定配置消除39.4%–67.9%的遗忘,且不损害目标域学习。
Figure 1: Overview: where the forgetting lives, why it lives there, and what acting on it buys.
arXiv深度剖析
遗忘在参数空间中是可定位的:冻结输出嵌入中低二阶矩的行可消除31.3%–51.0%的遗忘(五个设置),而冻结同一频段的输入嵌入几乎无效,低二阶矩的body频段也只贡献0.4%–12.3%。 此前关于遗忘位点的报告在早期注意力、低层与FFN之间相互冲突,多依赖权重位移这类相关性指标;本文用训练时冻结直接检验必要性,把因果份额归到具体的输出嵌入行。 六个设置(至1.4B)的逐组冻结网格,含参数量匹配的body对照;Qwen上随机输出行仅消除12.1%且付出学习代价,而最低二阶矩坐标消除42.7%且无代价。
遗忘位置由语料的词汇缺失度而非训练模式决定:在同一基座模型上,基线遗忘随词汇缺失度严格排序(410M上math/code/韩语为0.043、0.080、0.657 nats),因此可在重训练前仅凭分词计数做风险排序。 把定位从训练方式转向数据侧变量,并给出一个无需训练、只用基座分词器即可计算的预训练前诊断量。 三个模型上预测的秩与实测严格一致,并与此前四组(检查点,语料)比较相符;但跨模型的绝对量级预测失败,十组配置的Spearman秩相关为0.60,低于预注册阈值0.7。
机制上,未作为目标出现的词只收到单向softmax梯度,Adam的二阶矩归一化把微小梯度放大为接近满学习率的更新;仅对输出投影调高二阶矩即可选择性刹车,因为输出坐标的中位数比body低两到三个数量级。 把Adam的二阶矩同时指认为放大器与刹车,并给出无需显式词表的单行优化器改动;冻结欠曝光行与逐步门控两种等价手段在五个设置上结果接近。 120步的位移测量显示最低频段阻尼达48.0–189.2倍而最高频段仅1.4–1.8倍;SVD显示缺失行位移能量集中于单一方向(66.1%–80.8%),对照的高曝光行为3.2%–12.9%。
该干预在八个设置中消除39.4%–67.9%的遗忘(七个稳定配置),与replay可加性叠加(Qwen/韩语79.8%),并把放开输出头的LoRA从23倍遗忘激增中救回;但训练后编辑漂移行最多只恢复不到5%的遗忘。 相对需要原始数据的子空间方法与盲目约束整体漂移的正则化,这里给出零计算开销、无需逐模型调参、且必须训练时生效的防御。 160M至12B、四个模型家族、三个种子(双峰的410M臂扩到六个种子);预算扩展到400M token时降幅不衰减反而上升(6.9B从53.9%到62.3%,12B从76.2%到84.1%)。
启示与展望
该结果面向无原始预训练数据的持续预训练与微调场景,尤其是新语料带来大量新词表、词汇缺失度高的域注入(如韩语、代码)。适用时,读者可在重训练前用基座分词器计算旧域位置中目标词出现次数低于阈值的比例:比例高说明遗忘由输出嵌入主导,值得对输出投影调高二阶矩;比例低说明遗忘在body,此时冻结会损害目标学习,replay或学习率缩放更合适。干预在低学习率平台上稳定,最优学习率不因干预而改变,因此一次标准学习率扫描即可,无需逐模型调参;与replay叠加时先启用零成本优化器改动,再用replay压制残余遗忘。
词汇缺失度诊断目前只预测秩序,不预测绝对遗忘量,且跨分词器校准未成功(OLMo的每token韩语损失看似接近英语,换算成每字节损失后却是四个家族中最不熟悉韩语的)。分布内微调时因果份额移入body,body-scoped在测得的两个单元中只有一个无损,作者将其登记为初步结果。同一设置内降幅并不均匀:Pythia-410M/韩语六个种子中有两个几乎无恢复且损失目标学习。规模比较仅限Pythia,二阶矩扫描覆盖三个Pythia检查点,能力检查早于主网格且条件不同(数学注入、1% replay)。适配器消融只用一个秩、两个基座模型。机制依赖逐坐标自适应优化器,Muon不在范围内。此外,注意力冻结在KoAlpaca上410M处消除42.7%的遗忘,高于输出作用域的29.8%,作者说明因果份额在未归一化模块间不可分割,注意力是否持有独立份额仍属开放问题。
