跳到主要内容
返回时间线
arXiv来源发表:

Fisher引导的子模数据选择让1B精选token在医学持续预训练中同时优于10B回放token的适配与抗遗忘表现

相关研究与后续进展

核心概要

该工作发现基于损失的数据选择会使持续预训练后的Fisher对角在高Fisher坐标上系统性下降、而低Fisher坐标基本不变,据此提出将候选样本梯度分解为锚定分量与前沿分量、并用对数行列式子模目标在单遍流式流程中优化的Fisher感知选择器,在TinyLlama-1.1B与Llama-3.1-8B的医学数据持续预训练中提升目标域质量并约束遗忘,且1B精选token在适配与遗忘两项上均优于10B token的回放策略,呈现约10倍token效率优势。

Source-provided article image: Fisher-Guided Submodular Data Selection for Continual Pre-Training of Large Language Models
Figure 1 ·

Figure 1: Parameter-agnostic CPT erodes high-Fisher directions. Diagonal Fisher entries after CPT. Left: Parameter-agnostic CPT produces substantial negative drift on high-Fisher coordinates (orange regions), indicating damage to directions where the pretrained model had strong commitments. Right: Our Fisher-guided selector mitigates this drift while concentrating acquisition (blue regions) in low-Fisher coordinates where the pretrained model is less committed.

arXiv

深度剖析

论文报告了一个参数空间层面的遗忘机制:基于损失的选择会让持续预训练后的Fisher对角在预训练模型已经“承诺”的高Fisher坐标上向下漂移,而低Fisher坐标大体不受影响。 以往持续预训练实践要么用困惑度等与参数无关的标量给候选打分,要么靠额外消耗大量通用域回放token来缓解遗忘,都不直接追问“在某个候选上训练会如何移动模型参数”;该工作把遗忘问题重新表述为参数空间中的不对称漂移。 证据来自对持续预训练前后Fisher对角的对比观察,作者将其概括为“asymmetry exposes a parameter-space mechanism for catastrophic forgetting”;文本给出的是机制性观察,未在摘要中列出具体坐标数量或统计量。

作者提出Fisher感知的持续预训练选择器,把每个候选样本的梯度分解为锚定分量(衡量沿已承诺参数方向的扰动)与前沿分量(衡量在未受约束的低Fisher子空间中的更新容量)。 相对参数无关的标量打分与通用域回放,该分解直接以参数移动方向为选择依据,把“适配”和“遗忘”两个目标放进同一组信号中。 方法描述明确给出两个分量的定义与作用,属于设计层面的贡献;摘要未给出分量的具体计算细节或消融结果。

这些信号通过对数行列式子模目标聚合,并在可扩展的流式数据选择流程中以单遍方式优化。 相比需要多轮迭代或额外回放预算的做法,该目标与流式流程的组合使选择可在一次遍历中完成,面向的是web规模语料与有限token预算的现实约束。 摘要陈述了目标函数形式与单遍流式优化方式,未报告选择阶段的计算开销数值或与替代目标的对比。

在TinyLlama-1.1B与Llama-3.1-8B上针对医学数据的持续预训练中,该选择器提升目标域质量并在留出的预训练基准上约束遗忘;1B精选token在适配与遗忘两项上均优于用10B token训练的回放策略,形成约10倍token效率优势。 相对遗忘感知回放,该结果把达到更优适配与更少遗忘所需的token量降低约一个数量级,说明选择质量可以替代部分回放预算。 证据为两个模型规模、医学目标域、留出预训练基准上的对比实验,并给出1B对10B的token效率比较;摘要未列出具体指标数值、基准名称或方差。

启示与展望

该结果面向以医学数据为目标域的持续预训练场景,在TinyLlama-1.1B与Llama-3.1-8B两个模型规模上验证,评价维度为目标域质量与留出预训练基准上的遗忘程度。它适用于token预算有限、需要在适配与保持通用能力之间取舍的持续预训练流程,尤其是希望用数据选择替代部分通用域回放的情形。方法依赖对候选样本梯度与Fisher信息的估计,并以单遍流式方式完成选择,因此其适用前提是能够获得这些梯度信号并接受一次遍历的选择开销。

摘要未给出具体评价指标数值、留出基准名称、Fisher漂移的量化统计以及选择阶段的计算开销,因此10倍token效率优势的稳健性仍需在正文的完整实验设置中确认。锚定与前沿分量的相对权重、对数行列式子模目标的近似质量、以及该机制在医学以外目标域和其他模型规模上的表现,属于值得进一步观察的开放问题。若仅依据当前可见文本,尚不能判断该选择器与困惑度打分、通用域回放之外的其他持续预训练策略相比的完整位置。

来源