跳到主要内容
返回时间线
arXiv来源发表:

LLoCoT 用循环 Transformer 迭代精炼潜在工作区,在 HumanEval 与 MBPP 上以并行潜在推理达到与显式 CoT 相当的准确率,并将首答延迟降低约 36 倍

核心概要

作者提出 LLoCoT:用共享 Transformer 对紧凑潜在工作区做少量迭代精炼,替代从左到右的潜在生成,再由概率头并行采样潜在 token 以条件化自回归解码器;在 HumanEval 与 MBPP 上其平均准确率与显式 CoT 基线 Reasoning SFT 相当,并优于基座模型、仅答案 SFT 与 NF-CoT,同时相对 Reasoning SFT 将首答时间降低约 36 倍、推理阶段延迟降低约 42 倍、端到端吞吐提升 9.2%。

Source-provided article image: From Chain-of-Thought to Loops: Non-Autoregressive Latent Reasoning via Looped Transformers
Figure 1 ·

Figure 1: Overview of the LLoCoT architecture. A shared transformer repeatedly refines K loop hidden states, with each non-final Gaussian mean providing feedback to the next loop. The final Gaussian head generates all final latent thoughts jointly for autoregressive answer decoding; VAE-derived targets and auxiliary intermediate supervision are used only during training.

arXiv

深度剖析

LLoCoT 把潜在推理从“从左到右逐个生成潜在向量”改为“对紧凑潜在工作区做迭代精炼”:同一个共享 Transformer 被重复应用少量精炼轮次,依据提示与不断演化的工作区状态联合更新潜在槽位。 此前的潜在推理方法大多仍保留潜在向量之间的从左到右依赖,而显式 CoT 则把额外计算表达为自回归生成的 token 序列;LLoCoT 用并行潜在槽位精炼取代串行思维生成。 该设计在文中以框架描述与训练目标的形式给出:训练使用由显式 CoT 导出的连续表示,并结合最终答案预测损失与对潜在状态的似然监督。

在 HumanEval 与 MBPP 上,LLoCoT 在所评估方法中取得最高均值,准确率与显式 CoT 基线 Reasoning SFT 相当,并优于基座模型、仅答案 SFT 与 NF-CoT。 这提供了与显式 CoT 基线在准确率上持平的证据,同时把推理计算从串行 token 生成转移到并行潜在精炼。 证据来自两个代码基准上的均值比较,属于摘要层面的结果陈述,未给出逐基准数值、方差或样本规模。

相对 Reasoning SFT,LLoCoT 将首个答案 token 的时间降低约 36 倍、推理阶段延迟降低约 42 倍,并将端到端吞吐提升 9.2%。 这些效率数字把“并行潜在槽位精炼”与可测量的延迟和吞吐收益直接关联,而不仅是准确率持平。 文中以约数形式报告相对 Reasoning SFT 的加速与吞吐变化,未说明测量硬件、批大小或统计不确定性。

该设计在保留概率化潜在建模与自回归答案解码的同时,用并行潜在槽位精炼替代串行思维生成。 它表明非自回归的潜在推理可以与概率采样和自回归解码器共存,而非必须放弃其中任一环节。 这是对框架组成与训练监督方式的描述性结论,与上述基准结果共同构成摘要层面的证据。

启示与展望

该结果面向需要显式 CoT 监督、且关注推理阶段延迟与吞吐的代码生成场景:在 HumanEval 与 MBPP 上,LLoCoT 以与 Reasoning SFT 相当的准确率换取并行潜在精炼带来的效率收益,适用于可以接受少量精炼迭代、并保留自回归答案解码的部署设置。对希望减少串行思维生成、同时保留概率化潜在建模的研究者与工程团队,这一框架提供了可复用的设计模板;其训练依赖由显式 CoT 导出的连续表示,因此适用于已有 CoT 标注或可生成 CoT 数据的任务。

摘要层面未给出 HumanEval 与 MBPP 的逐基准准确率、方差或样本规模,也未说明约 36 倍、约 42 倍与 9.2% 这些效率数字的测量硬件、批大小与统计不确定性;精炼迭代次数、潜在槽位数量与训练数据规模等关键配置同样未在摘要中展开。读者可继续关注:并行潜在采样在不同任务与模型规模上的稳定性、似然监督对潜在状态质量的影响,以及该方法在代码生成之外是否保持同等准确率与效率权衡。

来源