跳到主要内容
返回时间线
arXiv来源发表:

LoopVL 用共享参数循环 128 层,在 MMStar 上把 1B 骨干从 55.33 提到 63.47,并观察到跨循环的 Visual Aha Moment

核心概要

作者提出 LoopVL,把循环 Transformer 扩展到视觉语言模型:语言骨干基于 HRM-Text 开源框架与数据自行预训练,采用 Module-Loop 与 Model-Loop 嵌套的 H/L 共享参数结构,默认 H2L3 配置下一次前向执行 128 次 Transformer 层调用;在相同 0.14T token 训练预算下,LoopVL 在 MMStar、RealWorldQA、ChartQA 等基准上超过同层数的 Transformer-VL 1B,并接近或超过更大的 4B 稠密基线,同时作者报告了跨模型循环的视觉注意力重分配现象,称为 Visual Aha Moment。

AI-generated editorial illustration: LoopVL: Recurrent Visual Intelligence

深度剖析

LoopVL 把循环计算从语言模型扩展到视觉语言模型,用共享的 L/H 参数栈在持续演化的统一视觉语言状态上反复更新,而不是堆叠独立参数层。 此前循环 Transformer 与循环深度语言模型主要面向语言任务,本文把 Module-Loop 与 Model-Loop 的嵌套结构用于多模态状态,并让视觉 token 在循环中持续被更新。 论文给出完整架构描述:冻结的 Penguin 视觉编码器、两层 GELU 投影器、各 16 层的 L 与 H 参数栈,默认 H2L3 执行顺序 LLLHLLLH,一次前向共 128 次层调用;训练流程覆盖语言预训练、多模态对齐、多模态中训、监督微调与视觉强化学习。

在相同 0.14T token 训练预算下,LoopVL 在多项多模态理解与视觉推理基准上优于同层数的非循环基线,并接近或超过更大的稠密模型。 LoopVL 与 Transformer-VL 1B 拥有相同的 32 个唯一 Transformer 层与隐藏维度,但通过重复复用共享模块把执行深度从 32 提升到 128 层调用,从而在参数量不增的情况下取得更高分数。 表 1 显示 MMStar 从 55.33 提升到 63.47、RealWorldQA 从 55.29 提升到 70.98、ChartQA 从 51.12 提升到 74.52;LoopVL 估计训练 FLOPs 为 2.47,低于 Transformer-VL 4B (Deep) 的 2.89 与 4B (Wide) 的 2.99。

作者观察到 Visual Aha Moment:在模型循环边界处,视觉注意力分布出现明显变化,同一共享层在不同循环状态下表现出不同的视觉读取行为。 由于视觉 token 与图像块保持空间对应,作者可以把同一物理层在不同循环中的注意力对齐回图像区域,从而直接观察证据重分配,而不只是报告分数变化。 作者用归一化空间熵与 Gini 集中度在每一执行层测量注意力分布,并报告在改用全循环反向传播、以及移除视觉锚点与查询条件视觉门之后,跨循环注意力转移与边界集中现象仍然出现。

循环配置的组织方式本身影响性能:相同展开层数并不等价,训练与推理的循环配置匹配时表现最好。 作者把训练时独立训练的 H/L 配置消融与固定 H2L3 检查点的推理时调度扫描分开,说明执行深度之外,L/H 更新顺序与分配同样重要。 表 3 中 H1L3 与 H2L1 都执行 64 层调用,但 H2L1 在五个基准上均更好;表 4 中固定 H2L3 检查点时,H2L3 在五个基准上最高,MMStar 从 H2L1 的 29.40 升到 H2L2 的 51.33 再到 H2L3 的 63.47,而 H3L3 与 H4L3 分别降到 58.20 与 24.00。

启示与展望

这项工作面向图像输入、冻结视觉编码器的视觉语言任务,默认 H2L3 配置下一次前向执行 128 次层调用,训练数据预算为 0.14T token;作者指出当前分析刻画的是 HRM-Text 分层循环框架下的一种循环视觉计算,尚未覆盖原生多图理解、视频以及交互或智能体环境,也未联合适配视觉编码器与循环骨干。对读者而言,这提供了一条以共享参数换取执行深度的多模态扩展思路,以及一套把循环状态变化对齐回图像区域的可观察方法,适用于关注参数效率与多模态推理机制的研究与工程场景。

作者在展望中说明,由于计算限制,尚未训练一个更通用 Model-Loop 架构的匹配对照来研究 Visual Aha Moment,因此该现象是否内在于 Model-Loop 计算、还是依赖 LoopVL 特定的架构与训练选择,仍待检验;推理调度扫描只记录固定 H2L3 检查点对替代执行顺序的响应,并不构成长度外推或自适应停止的证据;跨循环空间重分配本身也不等同于准确率提升,作者明确表示不应把注意力重分配直接等同于更好的答案。此外,本证据包为全文解析,但部分图表以图像形式呈现,具体数值细节以正文表格与附录描述为准。

来源