把合成预预训练从1B推到7B、100B token后,作者发现省token的收益仍在,但来源不是语法先验而是长程检索
核心概要
该研究在500M至7B四种参数规模、四种预训练数据混合、五种预预训练任务和最高100B token的预训练预算下系统评估合成预预训练(PPT),发现其下游性能与token效率收益在规模上持续存在(3B规模至少节省21B预训练token),但没有一致证据表明收益来自语法先验,收益只出现在能改善长程检索的PPT任务上,且对代码与数学占比不敏感、仅在缺少网页文本时消失。
深度剖析
PPT的下游收益在参数与预算扩展下依然存在:在12个“规模×数据混合”组合中,9个组合的下游平均分至少提升0.6分,平均提升1.6分,且提升幅度在不同规模间相近(500M为0.8、1B为1.4、3B为1.3)。 此前PPT研究只在不超过1B参数、预训练预算低于2B token、以网页文本为主的设定下验证;该工作把范围扩展到500M至7B、最高100B token、四种公开数据混合,并报告在3B规模上至少节省21B预训练token(Marin上PPT在63B token达到PT-Only在84B token的水平)。 对照设计为同一初始化下的PT-Only与在留出文本上跑同样500步的Control基线;Control在各规模与PT-Only差距仅0.2至0.4分,而-Shuffle Dyck在12个组合中10个优于Control;3B的Marin配置用三个随机种子重复,下游各类别符号在三个种子中保持一致。
没有一致证据支持“语法先验”解释:PPT带来的下游提升并未伴随稳定的语法可接受性提升,BLiMP在12个组合中仅1个增益稳定,而下游平均有10个稳定;形态学与句法子组也没有稳定增益。 这与此前把PPT效果归因于语法先验的工作(Hu等2025;Mita等2026)形成分歧,且分歧在500M这一此前研究覆盖的规模上就已出现:C4上出现最大退化,而该数据正是此前报告增益的设定。 BLiMP按12个范式组报告总体与语义、形态、句法子组;作者以训练后半段(5K至10K步)多检查点均值与标准差判定稳定性,并指出单检查点估计在12个组合中有一半符号反转、平均差异1.50分,因此采用多检查点平均。
收益来自长程检索而非形式语法:需要定位序列中特定较早位置的任务有效,不需要定位的任务无效——-Shuffle Dyck(1.3)、非形式的NCA(1.2)与形式的MP-Struct Core(0.9)在3B上均提升4个数据混合中的3个,而只判断token是否出现过的Set使下游平均下降7.2分且无一混合获益。 作者据此提出,PPT诱导的是长程检索能力,而不是自然语言语法先验;这与先前工作关于“层级依赖”和“降低检索歧义”的线索一致,但在“模型学到了什么”上给出不同解释。 逐字检索基准上,-Shuffle Dyck在全部12个规模×混合组合中降低NLL,其中7个稳定,而BLiMP仅1个稳定;下游提升最大的LAMBADA、ReCoRD、HellaSwag都要求利用前文信息,与检索解释一致。
PPT收益对代码与数学占比不敏感,但依赖网页文本:把数学占比从1.3%提高到17.0%(网页占比从92.6%降到76.9%)后平均增益为2.0分,与Marin完整混合的1.9分几乎相同;而移除网页文本(剩82%代码与18%数学)后平均增益降到0.2分。 此前PPT只在以网页文本为主的语料上测试,未考察现代含代码与数学的混合语料;该工作显示结构信号并非来自代码与数学,而是与网页文本的存在相关。 在Marin上做五种数据组成变体(完整、17%数学、仅DCLM、仅FineWeb-Edu、去掉DCLM),逐字检索在五种变体中均改善、其中三种稳定;BLiMP在各变体中变化小且无一稳定。
启示与展望
该结果面向使用解码器-only语言模型、以网页文本为主的预训练流程:在500M至7B、最高100B token、四种公开数据混合下,PPT可作为低成本预热阶段加入,3B规模上至少节省21B预训练token,且PPT阶段仅占约4.74%墙钟时间。它适用于希望在不改变主预训练配方的前提下提升token效率的团队,也适用于设计合成预热任务的研究者——按本文结论,任务应针对长程检索而非自然语言语法。
OLMo3是唯一在多个规模上未获益的混合,作者把其直接消融与背后原因留作未来工作;7B仅覆盖Marin与-Shuffle Dyck,且约11 token/参数低于3B的33 token/参数,因此7B增益收窄有多少来自容量、多少来自预算仍未分辨;多数配置为单次运行,BLiMP的组间差异常落在检查点方差之内;Set任务为何显著损害性能、以及长程检索能力如何具体迁移到下游任务,仍是开放问题。
