跳到主要内容
返回时间线
arXiv来源发表:

Scaffolding Minds 用可学习脚手架编码器与自适应高斯采样器改造潜空间视觉推理,FrozenLake 平均提升 9.5 分、九项视觉推理基准平均提升 5.6 分

核心概要

该工作提出 Scaffolding Minds 两阶段框架:第一阶段用可端到端训练、经下游任务损失优化的脚手架编码器替代冻结通用视觉编码器来生成潜空间目标,第二阶段用均值与方差均可学习的高斯采样器在潜空间采样残差动作以支持强化学习探索,在 FrozenLake 空间规划上较最强潜推理基线平均提升 9.5 分(Level 32 上提升 19 分),在九个视觉中心推理基准上平均提升 5.6 分。

AI-generated editorial illustration: Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

深度剖析

第一阶段把潜空间监督目标从“冻结通用视觉编码器特征”改为“经下游任务损失端到端优化的脚手架编码器输出”,在 FrozenLake 上把平均准确率从 62.0 提升到 72.0,在九个视觉中心基准上把平均分从 66.3 提升到 70.9。 此前潜视觉推理方法(LVR、Mirage、CoVT、Monet、VaLR 等)的潜目标来自冻结的通用视觉编码器,与推理任务不对齐;该工作让目标本身成为可训练组件,脚手架编码器是视觉编码器的可训练副本加交叉注意力池化模块,仅训练时使用、推理时丢弃。 消融显示仅训练注意力池化模块即可提升,再让任务损失塑造视觉编码器进一步提升,两者合计构成相对冻结目标的完整差距;参数匹配对照中,仅在普通 SFT 中微调同一视觉编码器只带来小幅提升,说明增益主要来自目标优化而非新增参数。

第二阶段用输入自适应高斯采样器在潜空间采样残差动作,把潜块作为策略的一个动作纳入 GRPO 目标,与文本 token 共享同一奖励更新,在 FrozenLake 上把平均准确率从 72.0 提升到 75.0。 既有做法要么只优化文本轨迹(GRPO),要么用固定方差高斯对潜块做确定性正则(VLPO),都不采样替代潜动作、不产生潜空间探索;该工作用两个轻量 MLP 头学习均值和方差,均值头零初始化、方差头从小正值起步。 同一 Stage 1 检查点下,文本 GRPO 与 VLPO 增益较小且 VLPO 训练波动;仅学习均值或仅学习方差都只带来部分增益,两者同时学习增益最大;在冻结目标的较弱检查点上 Scaffolding RL 增益更大,说明潜空间探索空间更大时收益更明显。

两个阶段互补:Stage 2 能细化但不能替代 Stage 1 提供的潜目标,在较弱检查点上 Scaffolding RL 仍只达到低于脚手架编码器上最弱配方的水平。 这给出了两阶段范式中“目标质量”与“探索方式”各自作用的分解证据,而此前工作通常只改动其中一环。 在 FrozenLake 与九个视觉中心基准上重复了同样的两阶段消融,两个组件在两类任务上都提升且提升覆盖每个基准。

方法在空间规划与真实视觉推理两类任务上均优于图像生成式与工具调用式方法,且推理开销接近基座 VLM。 此前“用图像思考”的方法需要在推理时生成或操作显式图像,代价较高;该工作完全在潜空间完成多步视觉推理。 FrozenLake 上较图像生成方法平均高 10.7 分;九个基准上较最强“用图像思考”方法平均高 6.2 分;单查询延迟测量显示潜推理方法开销在较小范围内,而工具调用与图像生成方法开销明显更大。

启示与展望

该工作面向采用两阶段训练的潜视觉推理系统,适用于训练期能获得中间辅助图像(如 FrozenLake 的价值函数热力图、Zebra-CoT 中的裁剪、框、示意图与候选位置)的场景;推理时脚手架编码器与辅助图像都被丢弃,只保留 VLM,因此部署成本接近基座模型。对希望在不生成显式中间图像的前提下提升多模态推理的团队,它给出了可复用的两阶段配方:先优化潜目标,再在潜空间做奖励驱动探索。作者也指出,把框架扩展到辅助图像不可得或昂贵的设定、为新领域自动提出辅助图像、以及让潜块长度随推理步难度自适应,都是后续方向。

辅助图像在训练期的可得性是该框架的前提,辅助图像缺失或昂贵时如何扩展仍待回答;作者未穷举替代辅助图像设计,也未自动为新领域生成辅助图像。每个潜块使用固定 token 数,块长随推理步难度自适应尚未实现。教师强制与自预测潜块的对照显示精度差异很小,但该对照在视觉中心设定下进行,其他任务分布下的表现仍需观察。此外,本文为全文阅读,但部分表格中的数值在文本中以占位形式呈现,具体逐项数字需以原文表格为准。

来源