跳到主要内容
返回时间线
arXiv来源发表:

插值定位中间层并冻结权重,让gemma-3-4b多语言持续预训练在阅读理解上平均超过基座模型

相关研究与后续进展

核心概要

该研究在gemma-3-4b上对五个语系做持续预训练(CPT),通过插值CPT前后的模型状态定位遗忘发生的层,发现中间层回退对阅读理解恢复最大,而翻译效果随语系和方向变化;据此比较层冻结、层区间L2正则、事后层回退与模型汤等策略,发现保留插值定位到的层权重可显著降低相对联合CPT的理解损失,层冻结平均超过基座模型,但翻译结果好坏参半。

Source-provided article image: Specializing Without Forgetting: Analyzing Knowledge Preservation in Multilingual Model Adaptation
Figure 1 ·

Figure 1: (a) CPT baselines and targeted parameter alignment methods. (b) Held-in changes relative to Base. D-Rev and E-Rev restore Base weights after CPT; Freeze holds the selected window G G fixed during CPT, and L2-SP regularizes it. The targeted methods use G = [ 10 , 16 ) G=[10,16) for Belebele and G = [ 5 , 11 ) G=[5,11) for FLORES. The FLORES panels show translation directions separately and average the named families within each group.

arXiv

深度剖析

作者用CPT前后模型状态的插值来定位遗忘,发现中间层回退带来最大的阅读理解恢复,而翻译效应随语系与翻译方向不同而变化。 把“哪些层驱动多语言适应中的灾难性遗忘”这一问题从整体性能对比推进到逐层定位,并给出可复用的插值诊断手段。 在gemma-3-4b上覆盖五个语系,以阅读理解与翻译为评测任务,通过插值前后状态比较不同层回退的效果。

以插值定位的层信息指导CPT策略后,保留这些层权重可显著降低相对联合CPT的理解损失,其中层冻结平均超过基座模型表现。 将层定位结果转化为训练时干预(层冻结、层区间L2正则)与事后干预(层回退、模型汤),并与联合多语言及语系专用vanilla CPT基线对照。 四类策略与两类基线在同一框架下比较,报告了理解任务上的平均表现差异。

翻译任务上这些策略结果好坏参半,密集训练或事后回退常优于训练时约束与语系专用化。 提示理解与翻译对同一干预的响应并不一致,挑战了“按语系专用化即可兼顾对齐”的既有假设。 翻译结果按语系与方向呈现差异,未出现单一策略全面占优的一致模式。

作者主张多语言适应策略应结合目标语言、基座模型知识与下游任务来决定,并把插值定位作为在新场景下选择训练时干预前的诊断步骤。 从单一最优策略转向按条件选择的决策框架,并给出先诊断后干预的操作顺序。 结论建立在上述五语系、两类任务与多种策略的比较之上。

启示与展望

该工作面向以gemma-3-4b为基座、在五个语系上做持续预训练的多语言适应场景,评测聚焦阅读理解与翻译两类下游任务。其结论适用于需要在扩展新语言时保留原有能力的实践者,尤其是愿意在训练前先做层定位诊断的团队。插值定位被提出作为在新设定下选择训练时干预之前的诊断步骤,因此其价值在于指导策略选择,而非给出跨模型通用的固定层号。

结论建立在gemma-3-4b与五个语系之上,其他基座模型、语言与任务上的层定位是否一致仍是开放问题。翻译结果随语系与方向变化且好坏参半,说明干预效果依赖具体条件,读者需在自己的目标语言与任务上复核。此外,摘要层面未给出各策略的具体数值与统计细节,若需据此做工程决策,应查阅原文的完整实验表格。

来源