Vantage 让 VLM 先“找视角”再推理,六个模型在五个空间基准上免微调平均提升 6.7%
核心概要
该工作提出 Seek-and-View 范式与免训练、模型无关的 Vantage 框架:VLM 先分析问题并规划一个相对参考视角的相机动作,再由 3D 基础模型重建场景并重投影合成该视角,连同推理上下文一起送入最终答题;在六个 VLM、五个空间推理基准上无需微调即取得一致提升,平均准确率增益 6.7%。
Figure 1: (a) Existing approaches reason over fixed views, suffering from fragile cross-view alignment and the geometry-to-language bottleneck. (b) Our novel Seek-and-View reasoning paradigm seeks a question-relevant view (see bottom right) to make the spatial evidence directly observable.
arXiv深度剖析
提出 Seek-and-View 范式:不再只在固定稀疏输入视角上推理,而是先寻找一个与问题相关的视角,把分散在不同视角中的空间证据集中到一次可观察的观测中。 相对既有的 View-and-Reason 做法(把几何语言化或注入几何先验),该范式把“看哪里”变成推理的一部分,从而绕开语言层面的跨视角对齐。 论文以范式论证加实验验证的方式给出支持:在五个基准、六个 VLM 上均观察到提升,平均准确率增益 6.7%。
Vantage 用两阶段流水线实现该范式:视角锚定推理阶段做问题分析与视角规划,几何锚定证据增强阶段由 3D 基础模型合成新视角并连同推理上下文增强最终 VQA。 把语义层面的相机意图与可执行的几何变换解耦:VLM 只在 17 个预定义相机动作(旋转、平移、混合,各三档幅度)中选择,精确位姿由重建后端确定。 消融显示结构化动作选择优于直接预测 6-DoF 数值位姿,也优于随机动作与视角插值;问题分析缺失时 Qwen3-VL-4B 在 MindCube-tiny 上从 38.9% 降至 30.0%。
合成视角、问题分析与推理指引三类上下文互补:仅用合成视角即可提升平均准确率,叠加文本上下文后进一步提升,三者齐全时表现最好。 说明增益来自“寻找与问题相关的视角”,而非单纯增加更密或更连续的观测。 在 Qwen3-VL-4B 上三者齐全相对基线平均提升 7.9 个百分点(相对 +24.7%),Gemma-4-31B 上提升 4.1 个百分点(相对 +8.7%)。
对 600 个错误预测的审计显示,残余错误主要来自视角锚定推理阶段的分析错误与视角规划错误,而非合成质量。 把当前多视角空间理解的瓶颈定位到“该看什么、如何到达”,而不只是几何推理能力本身。 跨四个模型、三个多视角基准各随机抽取 50 个错误样本,按错误率加权并做宏平均;不可靠合成较少,多出现在反射、透明、严重遮挡、近景、暗光、模糊或低分辨率等条件下。
启示与展望
该结果面向静态真实场景中的多视角空间 VQA,即答案由场景内几何关系决定的任务;评估覆盖 MindCube-tiny、MMSI-Bench 的位置关系与属性子集、BLINK 的多视角推理子集,并额外纳入 OmniSpatial 的视角采择子集与 SPINBench 的动态旋转、动态平移子集。方法为免训练、模型无关,可直接叠加在现有 VLM 上,适合希望在不做任务特定微调的前提下提升跨视角空间问答的研究者与工程团队;合成视角只重排输入视角中已观测到的像素,未覆盖的表面保持为空,因此它是补充而非替代原始观测。
增益在不同模型间并不随规模单调增长,且 Qwen3-VL-8B 上视角插值在个别设置中略优于本方法,说明效果与底层 VLM 和 3D 基础模型的能力耦合。论文将残余错误主要归因于问题分析与视角规划,但错误分类依赖对 600 个错误样本的人工标注与按错误率加权估计,其类别边界与估计稳定性值得读者结合附录中的分类流程自行判断。此外,动作幅度只有小、中、大三档,平移距离以场景单位定义,在重建点云非度量尺度下跨场景的绝对距离不可直接迁移;视野角的选择也会影响合成视角能覆盖多少空间上下文。作为免训练框架,其 rollout 质量随底层模型变化,端到端优化被留作未来工作。
