跳到主要内容
返回时间线
arXiv来源发表:

SpatialCORE 把「框得准不准」和「框得自不自信」一起写进奖励,8B 模型在 OmniSpatial 与 SpatiaLab 上超过同规模开源与专用空间推理模型

核心概要

SpatialCORE 是一个基于 GRPO 的后训练框架,它用模型自身生成 grounding(边界框)时的坐标 token 不确定性来加权几何匹配质量,并用答案门控把 grounding 优化与最终答案正确性绑定,使模型学会从「既准确又自信」定位到的任务相关物体出发进行空间推理;在 OmniSpatial 留出测试集上 SpatialCORE-8B 取得开源与专用空间推理模型中最高的加权平均准确率,并在未参与训练的 SpatiaLab 上零样本领先,消融显示去掉置信度加权后准确率从 56.33% 降到 52.33%。

AI-generated editorial illustration: SpatialCORE: Confidence-Aware Grounded Spatial Reasoning in Large Vision--Language Models

深度剖析

论文提出 SpatialCORE,把模型对自身生成 grounding 的置信度变成空间推理的学习信号,核心是「自调节空间奖励」:用每个预测边界框的坐标 token 不确定性(归一化熵)作为置信度权重,去乘该框与伪真值框的匹配质量。 此前带 grounding 的空间推理方法主要只优化最终答案正确性,或额外奖励定位是否正确,但都没有把「模型生成这个框时有多确定」纳入奖励;论文明确指出,答案正确时整条轨迹(包括高不确定性的框)都会被强化。 方法层面给出了完整公式:坐标 token 熵的归一化定义、置信度下限、置信度加权匹配质量、以及按伪真值有效性加权的软召回项,并用 F-beta 调和平均组合;附录 B 用 GRPO 梯度分析说明答案-only 监督下同答案轨迹的坐标 token 获得相同优势,置信度加权可打破这种无差异。

论文用「答案门控」把空间奖励与最终答案正确性耦合:答案正确时使用完整空间奖励,答案错误时正的空间奖励按系数缩减,从而让错误答案轨迹仍能保留有用 grounding 的部分信用。 这区别于只奖励正确答案的做法,也区别于把 grounding 与推理轨迹分离的纯定位监督;论文称其目的是让 grounding 在模型尚未稳定给出正确答案时就能先改善。 消融中移除答案门控使准确率从 56.33% 降到 54.67%,论文报告该门控贡献 1.66 个百分点;奖励配置中空间答案门控系数为 0.3。

在 OmniSpatial 留出测试集(1,533 样本、4 个推理维度、50 个子类)上,SpatialCORE-8B 取得开源与专用空间推理模型中最高的加权平均准确率,超过其 GRPO 训练骨干,并在交通分析与定位等需要同时比较多个任务相关物体位置的任务上增益最大。 论文报告相对专用空间推理模型 VST-RL-7B 与 SpaceThinkerQwen2.5VL-3B 的领先幅度尤其大,并称其表明置信度感知 grounding 比单纯 grounding 监督提供更强的训练信号;同时 SpatialCORE-4B 在平均准确率上仍具竞争力。 结果以表格形式给出各方法在 OmniSpatial 各子类上的准确率与加权平均;论文同时报告了与骨干、标准 GRPO 变体的对照,并指出全中心与假设性推理增益较小,因为需要跨多个视角推理,而单一自我中心视角的预测框无法解决。

在未参与训练的 SpatiaLab(1,400 个真实场景问答、6 类空间推理)上,SpatialCORE-8B 零样本领先开源与专用模型,并在关系定位类别上增益最强;grounding 分析显示后训练后最低不确定性四分位的平均匹配 IoU 最高,熵–IoU 相关性从 -0.32 变为 -0.61,答案准确率从 43.90% 升到 48.46%,边界框坐标不确定性从 0.42 降到 0.31。 论文把零样本迁移与置信度–定位质量对齐的改善联系起来,说明自调节空间奖励学到的不只是训练分布上的定位行为;同时指出尺寸与尺度估计增益较小,场景级尺度估计仍是另一类挑战。 零样本评测使用与训练不同的任务设计与视觉分布;对齐分析按不确定性四分位报告匹配 IoU,并给出熵–IoU 相关系数与准确率、不确定性数值;伪真值质量审计中 262 个框有 251 个正确(95.8%),且所有错误都出现在 Grounding DINO 两个较低置信区间。

启示与展望

这项工作面向以边界框形式生成 grounding 的空间推理后训练,适用于任务相关物体可被框选、且能构造出可靠伪真值框的问答场景;论文用 Qwen3-VL-8B-Thinking 与 Qwen3-VL-4B-Thinking 两个骨干实例化,在 OmniSpatial 训练划分上后训练,并在 OmniSpatial 留出测试集与 SpatiaLab 上评测。对希望把置信度信号引入多模态强化学习的读者,它给出了一套可直接复用的奖励构造:坐标 token 熵、伪真值有效性加权、匈牙利匹配与答案门控。论文指出后续可加入深度、多视角上下文或几何增强编码器,以处理 3D 与不可框选的空间概念。

论文的增益集中在需要比较多个任务相关物体位置的任务上,全中心与假设性推理、尺寸与尺度估计的增益较小,这些方向是否受限于单一自我中心视角的输入表示,仍是开放问题。伪真值框由 Grounding DINO 离线生成并经过人工审计,训练信号依赖这一参考质量;论文用 40% 损坏实验显示性能仍高于未适配骨干,但相对原始伪真值的准确率下降 1.76 个百分点,参考质量与最终收益之间的关系值得继续观察。此外,评测集中在 OmniSpatial 与 SpatiaLab 两个基准,其他任务设计与真实机器人闭环场景中的表现尚待验证。

来源