跳到主要内容
返回时间线
arXiv来源发表:

循环语言模型在训练视界之外继续展开循环时,推理任务得分上升而知识任务下降,历史状态注入加时间步条件化可缓解这一失衡

核心概要

该研究在受控预训练设置下系统考察循环语言模型(LoopLM)的循环何时有益、应放在何处以及如何条件化,发现超出训练视界的额外循环能提升推理表现(如某配置推理得分从28.52升至31.49)却使知识表现下降(从62.80降至52.11),非循环输出层可增强欠展开鲁棒性,而提出的历史状态注入(尤其通道式)结合时间步条件化能在扩展展开时更好地保留知识并提升跨推理预算的稳健性。

AI-generated editorial illustration: What Makes Recurrence Effective in Looped Language Models?

深度剖析

额外循环在训练视界之外对推理与知识产生分化影响:推理表现继续提升,知识表现下降,且更难的推理实例并不必然获益更多。 此前工作主要在固定训练循环深度下评估LoopLM或关注提前退出,未系统刻画超出训练视界的测试时循环扩展;该研究以受控实验覆盖低于、等于和超出训练视界的推理预算,并按知识/推理任务分组评估。 在Llama3.1-1B与Qwen3-0.6B骨干上从零预训练,匹配物理深度、训练有效深度、推理有效深度与训练流程;报告了具体数值,如推理从28.52升至31.49、知识从62.80降至52.11,以及ProofWriter深层证明约7.5个百分点的绝对增益。

循环的有效性取决于物理深度与循环次数的分配,而非仅由有效深度决定;非循环边界层的放置也随推理预算变化。 以往设计常以有效深度或固定架构评估LoopLM,该研究显示相同训练有效深度下不同物理深度/循环次数组合的扩展行为差异显著,并区分BaseLoop与CoreLoop中Prelude/Coda的作用。 在匹配有效训练深度与token预算下比较多种配置;发现浅物理核心多循环的配置早期达峰后退化,深物理核心少循环的配置在扩展时较平坦,而Coda层缓解欠展开时的知识退化,Prelude偏重的分配更利于推理外推。

常规初始状态注入对变化循环深度的鲁棒性有限,高容量稠密注入在深度展开时会导致知识性能崩溃;提出的历史状态注入以相对状态差为条件,能显著挽救深度外推表现。 初始状态注入(如Huginn式拼接加线性投影)被广泛采用,但该研究系统比较标量、通道式、残差通道式与稠密参数化,发现其局限,并提出基于历史状态相对差分的替代条件化方式。 在Qwen3-0.6B与Llama3.1-1B上评估多种注入变体;稠密初始状态注入在扩展时出现知识崩溃,而标量历史注入在窗口为1时于某深度取得最高总体与知识得分,分别超过BaseLoop 1.64和6.89个百分点。

历史状态注入与时间步条件化构成最强互补组合,通道式历史状态注入加时间步条件化以较低成本在扩展推理预算下同时改善知识与推理。 该研究不仅提出两种条件化机制,还通过成对组合实验与几何分析(计算交互)说明二者互补来自跨循环交互增强,而非单纯更大的状态变换幅度。 在Qwen3-0.6B BaseLoop上评估所有成对组合及三者组合至3倍训练深度;H+LG在深度84达到37.30总体准确率,超过I+H(36.91)和I+LG(36.33),且加入初始状态条件化无额外收益;通道式历史注入权重为2,048,远少于稠密历史的2,097,152。

启示与展望

该研究面向从零预训练的循环语言模型设计者,适用于约1B参数以内、固定token预算、手动指定循环次数的设置;其结论为在低于、等于和超出训练视界的推理预算下选择非循环边界层分配、状态条件化与时间步条件化提供参考。历史状态注入与时间步条件化的组合在通道式参数化下以较少额外参数取得跨预算的稳健增益,适合作为LoopLM条件化设计的低成本起点。

实验限于约1B参数以内模型与固定token预算,外推仅到训练视界的固定倍数,且循环次数为手动指定而非自适应;几何分析(如计算交互)与下游性能的关系仍需进一步研究。此外,历史状态注入与时间步条件化的最优窗口与门控类型随配置和任务变化,尚无在所有配置和指标上一致占优的变体。

来源