跳到主要内容
返回时间线
arXiv来源发表:

同一套 token 级交互分解,把数据选择、碰撞与侵蚀式遗忘、以及可塑性下降串成一条学习动力学链条

核心概要

该工作提出一种 token 级、逐层的更新—行为交互分解,把学习一个 token 如何改变另一个预测拆成直接力对齐通道(CH1)与经共享读出几何传播的弥散通道(CH2),并给出仅依赖 logits、隐状态与读出矩阵的前向可计算近似;沿时间追踪该交互后,作者报告正交互可用于数据选择、负交互分为集中的“碰撞”与累积的“侵蚀”两种机制并对应不同干预,长期训练中共享读出对任务方向传输能力的下降与未来可学习性下降同步,恢复读出可部分找回可塑性。

AI-generated editorial illustration: Learning Dynamics of Continual Learning: A Unified View of Data Attribution, Forgetting, and Plasticity Loss

深度剖析

论文把持续学习中的三个问题——该学哪些经验、这次更新会改变什么、之后还能不能继续学——统一为同一个不断演化的更新—行为交互,并给出 token 级、逐层的分解:分离 softmax 力、共享读出几何与残差连接后,交互呈现为直接力对齐通道 CH1 与经共享读出耦合的弥散通道 CH2,且在恒等路径与局部线性块近似下化为前向可计算量。 相对此前以样本级交互为单位的 learning-dynamics 框架(Ren & Sutherland, 2025),这里把粒度细化到 token 与层,并显式打开模型结构,使交互不再需要全参数 Jacobian 即可反复测量。 分解在论文中给出推导(Proposition 2.1),并报告在读出单独更新时 CH1 与实测 log-probability 变化几乎一致;CH2 的数值保真度在附录 C 中单独刻画。

正交互可直接当作数据选择准则:在受控归因基准上 CH1 在句法变换与数学归因上接近饱和,而在削弱输出词表重叠的跨语言设定中,加入 CH2 后 Qwen2.5-1.5B 的检索准确率从 0.488 提升到 0.625(MMLU)、从 0.445 提升到 0.600(GSM8K);在多语言 agent 记忆检索中,Llama3.2-3B 的 top-1 检索准确率由 0.861 提升到 1.000,并带来下游答题准确率提升。 与基于影响函数或梯度对齐的归因方法不同,该分数只需前向量,无需逐样本反向传播;论文报告在 1% 预算下用 CH1+CH2 选出的 GSM8K 子集微调后准确率高于随机选择与 LESS。 证据来自受控归因基准、跨语言检索与子集微调三类实验,覆盖 Qwen2.5-1.5B、Qwen3-4B、Llama3.2-3B 等模型;论文说明分数在 100 步同分布预热后计算,下游微调从原始基座检查点开始。

负交互被区分为两种机制:碰撞是少数高能量更新造成的集中干扰,可由 token 能量判据识别(Proposition 4.1 给出极端能量与大幅负力之间的双向界),对能量掩码敏感;侵蚀是大量弱交互沿同一竞争行为反复累积,改变监督的响应格式可重定向干扰而不妨碍新任务学习。 此前遗忘多被作为单一现象处理,或从表示/任务子空间重叠角度解释;这里用带符号的局部交互把突发能力损失与渐进行为漂移放进同一框架,并给出机制对应的不同控制手段。 论文报告能量掩码在极端能量区间有效、阈值过严会显著损害下游学习;格式分离实验中 GSM8K 在所有设置下都被学到,而指令跟随退化随格式匹配程度变化,并在指令微调模型上做了补充验证。

长期训练会重塑共享读出几何:任务条件化的读出传输(沿任务诱导力方向的 Rayleigh 商)在约 1 亿 PubMed token 的持续训练中,对三个分布外任务(GSM8K、MBPP、Dolly-QA)逐步下降,而同分布 PubMed 无同等系统性衰减;该下降与后续适应变慢同步,把读出恢复到基座值可显著改善验证损失,且退化幅度与恢复收益强相关(论文报告 OOD 任务上 Spearman 相关)。 这把可塑性下降从独立的失效模式变成同一交互几何的演化结果,并给出一个可测量的诊断量,而非仅事后观察微调变难。 证据来自长程 PubMed 训练轨迹上的检查点测量、顺序 SFT 的受控读出重塑实验,以及跨模型、任务、检查点的读出重置对比;论文明确把读出视为重要但非唯一来源。

启示与展望

该框架面向把经验固化进参数的梯度式更新这一环节,适用于带残差连接与共享读出的 Transformer 语言模型;作者说明当系统主要依赖上下文学习或外部记忆时,选择、干扰与可持续性的循环仍会出现,但机制不同。可操作的对象包括:用交互分数在候选池中排序经验、用能量判据筛查高冲突更新、用响应格式分离重定向侵蚀、用读出传输作为长期可学习性的诊断并据此决定是否恢复读出。作者强调读出恢复是机制性干预而非部署策略,在恢复可塑性的同时保留长程训练所得能力不在该诊断范围内。

作者自述分析本质上是时间局部的:交互分析针对单次更新,而遗忘与可塑性损失是多次更新累积的结果,因此机制论证是把局部结构沿训练轨迹外推,预测由实验验证而非由精确的多步理论导出。近似方面,一阶展开、恒等路径与线性块近似共同决定保真度;论文报告交互幅度在冷启动时已可靠,但带符号的保真度在初始化时可能失效,需少量同分布适应后恢复,且符号误差随残差深度累积。优化器方面,推导以 SGD 为规范设定,自适应优化器改变各通道权重与排序,但不改变通道来源;解耦权重衰减不影响固定观测下的候选排序。经验范围上,作者把结果定位为机制性模式而非普适定量规律,并指出高阶残差路径、优化器状态演化、更长程反馈与更广架构仍是开放方向。此外,本次载入的正文中部分表格以空单元格形式呈现,若需核对具体数值仍需回到原文附录。

来源