跳到主要内容
返回时间线
arXiv来源发表:

SVC 以奇异向量通道选择在四个 LLM 家族上同时提升持续学习性能与预训练能力保留

核心概要

该工作把每个奇异值对应的左右奇异向量对定义为一个“奇异向量通道”,用当前任务梯度估计其适配收益、用无标注通用语料上的激活二阶矩估计其遗忘代价,再经膝点代价筛选、Pareto 前沿过滤与 Otsu 阈值自动选出可训练通道;在四个 LLM 家族、八个 TRACE 任务与三种任务顺序下,SVC 在保持预训练通用能力的同时取得较强的下游持续学习表现。

Source-provided article image: Stability-Plasticity Balance via Singular-Vector Selection in LLM Continual Learning
Figure 1 ·

Figure 1: Stability–plasticity trade-off between LoRA and SVF. (a) GSM8K retention across fine-tuning tasks. (b) Downstream performance. Details in Appendix C

arXiv

深度剖析

论文提出以“奇异向量通道”作为控制稳定性—可塑性权衡的基本单元:每个通道是一对左右奇异向量方向,可被更新以获取新知识,或被固定以保留预训练能力。 此前的 PEFT 方法(如 LoRA、O-LoRA、SVF、SVFT、PiSSA、MiLoRA)在微调前就固定了可训练谱系数的集合,或仅相对前任务低秩子空间施加正交约束,并未用任务相关的收益与遗忘代价估计来决定哪些方向可训练。 该单元定义与动机来自对 LoRA 与 SVF 的对比观察:同一预训练模型独立适配八个 TRACE 任务时,LoRA 的 GSM8K 下降幅度差异明显,而 SVF 的方向约束带来更一致的保留但限制下游适配。

SVC 在微调前为每个通道估计适配收益与遗忘代价,并通过膝点代价筛选、Pareto 前沿过滤与 Otsu 阈值三阶段自动选出任务相关的可训练通道子集。 遗忘代价的理想评估需要历史激活,但历史数据不可得;论文指出历史数据只通过激活二阶矩进入评分,因而可用无标注通用语料近似,从而无需前任务样本或任务专属模块。 消融显示移除 Pareto 前沿过滤造成最大退化,几乎消除代码生成与数学推理能力的保留并显著降低序列性能;移除膝点代价筛选影响较小但仍削弱数学推理保留、降低序列性能并增加遗忘。

在四个 LLM 家族、八个 TRACE 任务与三种任务顺序下,SVC 在保留预训练通用能力的同时取得较强的持续学习表现。 在 12 个模型与任务顺序设置中,SVC 在 10 个 HumanEval 设置和 11 个 GSM8K 设置上达到或并列最佳;相对各设置中最强基线,HumanEval 平均提升 1.68 个百分点、GSM8K 平均提升 5.18 个百分点。 SVC 在几乎所有设置中取得最佳 OP,BWT 也显示遗忘明显减少;尽管不存储任何前任务样本,其 OP 持续超过两个 replay 基线,BWT 与之相当。在 48 个模型、任务顺序与指标组合中,SVC 有 46 个排名第一或第二。

通道评分与选择机制的有效性得到验证:代价评分能识别高风险更新方向,收益评分能反映通道对当前任务适配的贡献。 在代价匹配条件下比较高收益与低收益通道组,高收益组在最低代价与中等代价两个区域都取得更高 AP,说明收益评分捕捉了通道对当前任务适配的贡献,而非仅由代价差异驱动。 按最高、中等、最低代价区域选择通道时,预训练能力保留随所选通道代价降低而持续改善;高代价选择也会影响序列学习,提示过高代价可能抵消适配收益。

启示与展望

该结果面向需要在无前任务样本、无预训练数据条件下做领域持续适配的 LLM 实践者,适用于线性层可做 SVD 分解、且能提供一份无标注通用领域参考语料的设置。方法在四个开源模型家族(Llama3-8B、Mistral-7B-v0.3、Gemma2-9B-it、Qwen3.5-9B-Base)、八个 TRACE 任务与三种任务顺序上验证,参考语料固定为从 C4 与 Stack-v2-Python 按 2:1 采样的 30,000 条无标注样本。由于通道选择在微调前完成并在该任务训练期间固定,且训练后增量被合并回权重、不保留任务专属模块,该方法可直接嵌入不增长模型体积的持续学习流水线。

参考语料仅由 C4 与 Stack-v2-Python 按 2:1 构成,其对更广能力覆盖与分布偏移的稳健性尚待考察;通道选择在微调前一次性确定并在训练中固定,未建模通道间交互或训练过程中的动态调整;实验覆盖八个 TRACE 任务与三种任务顺序,更长任务序列与更广通用能力基准上的表现仍有待刻画。此外,收益与遗忘代价的推导依赖一阶泰勒展开与忽略二阶扰动项,且奇异值是否纳入通道的消融显示联合选择会降低 HumanEval、GSM8K、OP 与 BWT,论文将其部分归因于评分分布变化与奇异值在训练中持续调整,这一解释仍属可能原因而非定论。

来源