跳到主要内容
返回时间线
arXiv来源发表:

Flow-of-Thought 用轨迹流场生成中间视觉草图,在 Tetris 达 100%、彩色形状达 99%,并在 BLINK 多视角上以 72.2% 超过端点基线 63.9%

核心概要

该工作提出 Flow-of-Thought(FoT)框架,用流匹配在旋转轨道与迷宫最短路径前缀上训练坐标、时间与动作条件的空间 U-Net,学习连续视觉动力学并冻结;推理时以源图与其水平镜像作为竞争假设,按前景加权重建能量选择答案。在锁定测试上 Tetris 达 100.0%、彩色形状达 99.0%,迷宫端点 IoU 97.5%、目标到达率 100%;冻结迁移到 BLINK 多视角 133 对公开验证集时,轨道训练流达 72.2%,高于仅端点对照的 63.9%。

Source-provided article image: Flow-of-Thought: A Framework for Visual Reasoning
Figure 1 ·

Figure 1 : Training and inference in FoT. Top: the rotation example follows the rendered path x t = γ a ​ ( t ) x_{t}=\gamma_{a}(t) with target transport u ∗ ​ ( p , ω ) = ( − ω ​ p y , ω ​ p x ) u^{*}(p;\omega)=(-\omega p_{y},\omega p_{x}) . The field predicts u ^ t = v θ ​ ( x t , t , c , a ) \hat{u}_{t}=v_{\theta}(x_{t},t,c,a) and minimizes ℓ ⁡ ( u ^ t , u t ∗ ) \ell(\hat{u}_{t},u_{t}^{*}) ; thus only θ \theta is learned. For mazes, the same slots contain the trace τ ⁡ ( t ) \tau(t) , map condition m m , and additive field v θ ​ ( τ ​ ( t ) , t , m ) v_{\theta}(\tau(t),t,m) . Bottom: A 𝒟 A_{\mathcal{D}} maps an arbitrary compatible item to ( x 0 , c , ℋ , 𝒜 ) (x_{0},c,\mathcal{H},\mathcal{A}) . Each hypothesis/action is integrated under the same frozen field, producing the trace { x ⁡ ( t ) } \{x(t)\} and endpoint T θ ^ ​ ( x , a ) = x ​ ( 1 ) T_{\hat{\theta}}(x,a)=x(1) . Rotation pairs use the paper’s exact SAME/DIFFERENT energies E same E_{\rm same} and E diff E_{\rm diff} ; dense tasks return x ⁡ ( 1 ) x(1) . Only A 𝒟 A_{\mathcal{D}} and the readout are dataset-specific.

arXiv

深度剖析

FoT 把视觉草图作为中间推理步骤,用坐标、时间与动作条件的空间 U-Net 预测稠密输运场,并以 ODE 积分得到任意时刻的中间视觉状态,而非只输出最终预测。 与线性像素插值或仅监督最终变换的端点模型不同,旋转监督沿渲染轨道、迷宫监督沿最短路径的累积前缀,使模型学到连续轨迹而非单点映射。 消融在固定源样本、架构、优化器、更新次数、种子、冻结重建决策与动作网格的条件下比较:Tetris 轨道监督 100.0% 对端点 94.0% 对线性 39.0%;彩色形状 99.0% 对 85.0% 对 51.0%,端点 IoU 也同步提高。

冻结动力学后,同/异旋转判断通过比较源图与其水平反射两条生成假设的前景加权重建能量完成,无需配对标签、拟合阈值或目标任务适配。 决策证据直接来自可检查的中间轨迹所生成的端点,把生成式重建能量转化为判别式答案,而不是依赖语义记忆或额外分类头。 在锁定 100 对 Tetris 与彩色形状测试上分别达到 100.0% 与 99.0%,超过表中 ViT、DINOv3、Qwen3.5、GPT-4o、GPT-5.6、Claude 4.6 等条目。

冻结迁移中,轨道训练的 2D 流在 BLINK 多视角 133 对公开验证集上达到 72.2%,高于仅端点对照的 63.9%,作者将其视为主要的分布外证据。 这提示连续视觉轨迹监督在部分分布外设定下可优于仅端点监督,且超过表中 GPT-4V 的 58.7%,但低于已发表的 P2+Qwen3VL 94.0%。 两组区间分别为 [64.0, 79.1] 与 [55.5, 71.6],相差 8.3 个百分点但区间重叠,作者称其为提示性而非结论性;该评估的符号约定在两项冒烟检查后才最终确定。

迷宫任务中 FoT 直接生成路径,端点 IoU 97.5%、前缀 IoU 84.2%、目标到达率 100%、零障碍违规,但存在提前激活后续路径段的现象。 与只输出二值轨迹级回答的基线不同,FoT 输出可检查的累积路径掩码,使错误可归因于避墙、端点完成或路径激活时机。 提前激活率 31.7%、平均未来路径强度 0.164,说明强端点与前缀指标并不等于完全因果的绘制过程;作者也提醒生成指标不应与轨迹准确率行直接比较。

启示与展望

该框架面向需要逐步几何变换的空间任务:旋转同/异判断与迷宫最短路径生成。对读者而言,它提供了一种可复用的设计范式——用轨迹监督学习连续视觉动力学,冻结后以生成式重建能量做判别,并把中间帧作为可审计证据。适用设定是训练分布内的 2D 旋转与迷宫;迁移证据主要来自 BLINK 多视角公开验证集,作者将其视为主要分布外结果。作者指出后续方向包括物理更忠实的 3D 动力学、更大 3D 测试集、更严格的因果路径生成,以及把 FoT 作为多模态基础模型的外部工具集成。

读者仍需关注:BLINK 的符号约定在两项冒烟检查后才确定,作者称该结果为探索性;3D Blocks 仅 78 对,单个样本重分类即改变 1.3 个百分点,Wilson 区间 [50.4, 71.6] 跨度超过二十点,方法排序对种子敏感;迷宫提前激活率 31.7% 表明路径生成并非完全因果。此外,3D Blocks 与 BLINK 的迁移均未做目标任务训练,其表现能否在更大、更多样的 3D 测试集上保持,仍是开放问题。

来源