跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

插值定位中间层并冻结权重,让gemma-3-4b多语言持续预训练在阅读理解上平均超过基座模型

该研究在gemma-3-4b上对五个语系做持续预训练(CPT),通过插值CPT前后的模型状态定位遗忘发生的层,发现中间层回退对阅读理解恢复最大,而翻译效果随语系和方向变化;据此比较层冻结、层区间L2正则、事后层回退与模型汤等策略,发现保留插值定位到的层权重可显著降低相对联合CPT的理解损失,层冻结平均超过基座模型,但翻译结果好坏参半。