TAPS 让循环 Transformer 按轨迹自适应步长:Sudoku 准确率升至 91.39%、Maze 达 79.90%,并减少到达同等精度所需的循环次数
核心概要
该工作提出轨迹自适应进展—波动调度器 TAPS,用指数移动平均在线估计循环更新中的持续进展与中心波动并据此调整每步更新尺度,理论证明在给定条件下可降低期望终端损失、以更少循环达到目标质量,实验在 Sudoku、Maze 及语言模型与中间层循环等设置中提升终端准确率并带来最高约 1.5 倍墙钟加速。
深度剖析
论文把循环推理的更新尺度识别为独立于“重复什么计算”和“重复多少次”的第三条控制轴,并提出 TAPS:用指数移动平均跟踪相邻更新的持续进展与中心波动,按二者平衡在线选择松弛因子,进展占优时过松弛、波动占优时阻尼。 此前循环推理研究主要设计学习到的更新内容与循环深度,标准推理默认全程使用单位步长;该工作显式暴露这一隐含的单位尺度选择,并给出可在线运行的调度规则。 论文给出命题 1 与命题 2,说明终端损失对松弛因子的时间平均梯度可精确分解为持续进展项与中心波动项;并给出 TAPS 的多种实例(GD、P/S-Sign、Momentum、RMSProp、Adam、BB)。
理论分析给出 TAPS 降低期望终端损失、并在更少循环内达到目标精度的充分条件。 把可观测的轨迹统计量与依赖目标的任务敏感度联系起来,说明在代理—预言对齐与时间对齐条件下,控制器选择的符号与损失下降方向一致。 定理 4 给出单因子增益界,定理 5 给出累积增益与循环加速结论;附录 B.3 讨论假设,并用一个双模态不动点模型说明条件可在该模型中精确成立。
在 Sudoku 与 Maze 上,TAPS 无需重训练即提升终端准确率并缩短达到单位步长基线性能的墙钟时间;把进展—波动原则加入训练后进一步提升。 固定尺度(如常数 0.5、1.5)在不同任务上无法稳定提升准确率与速度,而六种 TAPS 变体在两项任务上均取得提升,说明收益来自沿轨迹自适应而非统一改变步长幅度。 表 1 报告:单位步长在 Sudoku 为 89.67%、Maze 为 78.80%;协同设计后最佳控制器达到 Sudoku 91.39%、Maze 79.90%,并给出对应的加速倍数。
TAPS 可迁移到多种循环架构与推理策略:自适应退出、分层循环、并行循环推理、不动点推理,以及语言模型循环与中间层循环。 把步长控制与已有的深度控制、收敛判据、宽度扩展策略组合,而不是替换它们。 自适应退出在 Sudoku-Extreme 上以 316.5 次有效更新达到 91.2% Exact,对比 FPRM 的 91.1%;不动点推理中,固定点推理 1000 次更新达到的精度被 TAPS 在约 260 次更新内匹配;语言模型上 Ouro-1.4B、Ouro-2.6B 与 Huginn-0125 的平均准确率均提升;中间层循环在 Qwen3-4B-Instruct 上所有控制器都选择大于 1 的尺度。
启示与展望
该结果面向使用循环或循环式推理的模型部署与训练场景:推理阶段只需观测到的轨迹统计量即可在线调整步长,无需目标标签,也无需修改模型权重;训练阶段可把进展—波动原则作为额外目标塑造动力学。适用对象包括潜在状态循环(TRM)、循环语言模型(Ouro、Huginn)与中间层循环(Qwen3-4B-Instruct),并可与自适应退出、分层循环、并行循环推理和不动点推理组合。理论保证在文中给出的代理—预言对齐与时间对齐条件下成立,附录中的双模态不动点模型展示了条件可精确满足的一类局部动力学。
理论结论依赖可观测能量与预言贡献之间的比较条件以及时间对齐条件,这些条件在更广泛的循环动力学中是否成立仍是开放问题;TAPS 以局部轨迹统计量作为代理,更丰富的信号是否带来更好控制尚待探索;训练—推理协同设计只是初步尝试,更深入的训练整合与更广架构仍待研究;更新频率存在非单调的准确率—效率权衡,过粗的控制粒度可能抵消节省的控制器开销;对高层隐藏状态的强扰动会削弱自适应收益,说明其依赖足够可靠的更新信号;本文为全文阅读,但表格与图注中的部分数值以占位形式呈现,具体数值细节需以原文表格为准。
