arXiv 2026年10月5日该工作发现基于损失的数据选择会使持续预训练后的Fisher对角在高Fisher坐标上系统性下降、而低Fisher坐标基本不变,据此提出将候选样本梯度分解为锚定分量与前沿分量、并用对数行列式子模目标在单遍流式流程中优化的Fisher感知选择器,在TinyLlama-1.1B与Llama-3.1-8B的医学数据持续预训练中提升目标域质量并约束遗忘,且1B精选token在适配与遗忘两项上均优于10B token的回放策略,呈现约10倍token效率优势。该工作发现基于损失的数据选择会使持续预训练后的Fisher对角在高Fisher坐标上系统性下降、而低Fisher坐标基本不变,据此提出将候选样本梯度分解为锚定分量与前沿分量、并用对数行列式子模目标在单遍流式流程中优化的Fisher感知选择器,在TinyLlama-1.1B与Llama-3.1-8B的医学数据持续预训练中提升目标域质量并约束遗忘,且1B精选token在适配与遗忘两项上均优于10B token的回放策略,呈现约10倍token效率优势。Fisher引导的子模数据选择让1B精选token在医学持续预训练中同时优于10B回放token的适配与抗遗忘表现该工作发现基于损失的数据选择会使持续预训练后的Fisher对角在高Fisher坐标上系统性下降、而低Fisher坐标基本不变,据此提出将候选样本梯度分解为锚定分量与前沿分量、并用对数行列式子模目标在单遍流式流程中优化的Fisher感知选择器,在TinyLlama-1.1B与Llama-3.1-8B的医学数据持续预训练中提升目标域质量并约束遗忘,且1B精选token在适配与遗忘两项上均优于10B token的回放策略,呈现约10倍token效率优势。该工作发现基于损失的数据选择会使持续预训练后的Fisher对角在高Fisher坐标上系统性下降、而低Fisher坐标基本不变,据此提出将候选样本梯度分解为锚定分量与前沿分量、并用对数行列式子模目标在单遍流式流程中优化的Fisher感知选择器,在TinyLlama-1.1B与Llama-3.1-8B的医学数据持续预训练中提升目标域质量并约束遗忘,且1B精选token在适配与遗忘两项上均优于10B token的回放策略,呈现约10倍token效率优势。