跳到主要内容
返回时间线
arXiv来源发表:

LoopCD 把循环 Transformer 的早期迭代当作弱参考,Ouro-2.6B 的 AIME 2024 pass@1 从 61.88% 升到 73.33%,并在半数循环下省下 22.5%–48.2% 前向 FLOPs

核心概要

该工作提出免训练的对比解码框架 LoopCD,把循环 Transformer 最终预测与更早一次循环的预测做对比来引导选词,分 logit 空间(多一次输出前向,LoopCD-Logits)与隐状态空间(零额外输出开销,LoopCD-Hidden)两种形式,在四个循环 Transformer 家族上于全循环深度取得一致提升,例如 LoopCD-Logits 把 Ouro-2.6B-Thinking 的 AIME 2024 pass@1 从 61.88% 提到 73.33%,LoopCD-Hidden 把 Huginn 的 HumanEval pass@1 从 22.56% 提到 31.71%,并因此可在把循环次数减半时仍匹配或超过全深度无引导基线

AI-generated editorial illustration: Decoding Looped Transformers Better for (Almost) Free

深度剖析

LoopCD 把循环 Transformer 的中间循环状态变成内置的弱参考,无需辅助模型或额外训练即可做对比解码。 以往对比解码需要辅助小模型、扰动上下文或中间层来获得对齐的弱预测;循环结构本身在同一参数块、同一表示空间内反复执行,天然给出同一前缀的对齐弱-强预测对。 论文在 Ouro、Huginn、Parcae、Looped-Qwen3 四个家族上验证,并给出机制证据:单独解码第一次迭代的预测比最终收敛预测在七项基准均值上低 4.0 到 23.7 个百分点,且增益随早期参考与最终预测的分歧增大而增大。

两种引导空间各有取舍:logit 空间多一次输出前向,隐状态空间在输出层之前合并表示、零额外输出开销。 论文把引导空间作为独立设计维度,并说明 LoopCD-Hidden 在 coda 之前合并状态,从而保持基线单次输出前向。 在多项选择评分上,LoopCD-Hidden 使 Huginn 七基准均值提升 +0.83 与 +0.75 点,超过固定强度 LoopCD-Logits 的 +0.74 与 +0.62;在代码生成上四列均值提升 +5.13 与 +3.76 点;附录进一步分析 coda 深度对隐状态增益保留的影响。

引导带来的增益集中在模型本来就不确定的决策上,本质是把接近的决策重新排序。 论文把 logit 对比向量分解为平行分量(类似温度缩放)与正交分量(纯重排序),并显示正交重排序分量单独使用即可达到或超过完整更新的增益。 在 HellaSwag 上,仅用正交重排序分量在 Ouro-1.4B 上得 +1.72 点、Ouro-2.6B 上得 +2.27 点,均高于完整更新的 +0.76 与 +1.56;按置信度分组后,最不确定的五分之一问题获得 +6.4 到 +13.3 点,而最确定的五分之一最多 +0.4 点,整体只有 5.8% 到 14.9% 的答案被改变。

这些增益可以换成算力:把循环次数减半后,LoopCD 仍匹配或超过全深度无引导基线,前向 FLOPs 减少 22.5% 到 48.2%。 论文把解码质量提升直接用于削减循环迭代预算,并给出按架构拆分的 FLOP 账目,说明节省受循环在整次前向中所占比例限制。 循环减半使无引导七基准均值下降 0.17 到 1.29 点,而在此深度施加 LoopCD 增加 0.75 到 1.29 点,覆盖 Huginn、Parcae、Looped-Qwen3 的六个设置;Huginn-0125 在 32 次循环中的 16 次下分别比全深度无引导基线高 1.02 点(Logits)与 0.51 点(Hidden)。

启示与展望

该结果面向使用循环 Transformer 的推理与生成场景:只要模型反复执行共享参数块、且中间状态可由同一输出头解码,就可以在解码阶段直接套用 LoopCD,无需辅助模型、无需额外训练、无需改动提示。它适用于数学推理、代码生成与多项选择评分等评测设置,并在把循环次数减半的配置下仍能匹配或超过全深度无引导基线;对完全循环的架构(如 Ouro、Huginn)与带较深 coda 的架构(如 Parcae、Looped-Qwen3),logit 与隐状态两种形式各有更合适的场合。

参考迭代的选择依赖架构初始化方式:Huginn 从高斯噪声初始化,其第一个隐状态受噪声主导,隐状态参考要到第六步才达到峰值,而 logit 参考普遍以第一次迭代最佳;引导强度在多项选择评分上可容忍较宽区间,但自回归生成需要更小的取值,否则早期 token 偏移会累积。论文也指出,循环减半的评测只在多项选择套件上进行,FLOP 数字是理论算术量而非端到端墙钟加速;此外,GSM8K 结果好坏参半,Looped-Qwen3 在数学推理上出现 pass@1 下降而 pass@10 上升的分化,这些都属于需要结合具体任务与架构继续观察的范围。

来源