跳到主要内容
返回时间线
arXiv来源发表:

SpatialSpeak 用 QA 式重建预训练把空间思维链增益从 2.6 分提到 6.9 分,ReVSI 达 62.8 分

核心概要

该工作提出 SpatialSpeak 两阶段框架:第一阶段以问答形式联合训练局部标记点 3D 坐标与全局物体中心重建(QA-RP),第二阶段用带视觉补偿的空间思维链(CoT-VC)监督模型表达并运用几何估计,在 ReVSI 上把 CoT-VC 带来的增益从 2.6 分提升到 6.9 分,并以 4B 参数在 ReVSI(62.8)、VSI-Bench(73.0)和 SPAR-Bench(76.0)上取得所比较方法中的最好结果。

AI-generated editorial illustration: SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning

深度剖析

QA-RP 让空间思维链监督更有效:在 ReVSI 上,没有 QA-RP 时 CoT-VC 只带来 2.6 分增益,加入 QA-RP 后增益升至 6.9 分。 此前工作多把预训练重建模型的特征注入 VLM,或只做几何训练目标,而这里把重建本身改写成文本问答目标,使几何估计与后续推理共用同一自回归输出接口。 ReVSI 消融实验:完整方法 62.8,去掉 CoT-VC 为 55.9,去掉 QA-RP 为 55.0,两者都去掉为 52.4;作者据此说明 QA-RP 放大了 CoT-VC 的作用。

局部与全局重建监督互补:去掉全局物体中心查询降至 59.9,去掉局部标记点查询降至 59.3,两者都去掉降至 55.0。 局部查询把图像点落到 3D 坐标,全局查询枚举可见物体实例并预测语义类别与 3D 中心,二者统一在第一帧相机坐标系下,覆盖了单一任务无法覆盖的物体分布信息。 ReVSI 上的消融对比,三种设置均低于完整方法的 62.8,作者据此支持联合学习局部几何与全局场景上下文。

视觉补偿(VC)在几何推导不可靠时提供回退:加入空间 CoT 但不含 VC 得 58.5,进一步加入 VC 得 62.8,额外提升 4.3 分。 CoT 目标中显式包含可靠性标记与视觉复核回退,当 3D 估计被标为 Low 时模型被训练为承认局限并依据视觉观察修正答案,而不仅是输出几何推导结果。 ReVSI 消融:无 CoT-VC 为 55.9,加 CoT 无 VC 为 58.5,完整为 62.8;可靠性阈值 0.1 时得 62.8,0.05 与 0.2 分别为 59.6 与 59.5。

以 4B 骨干在三个空间推理基准上取得所比较方法中的最好成绩:ReVSI 62.8(高于表中最高对比方法 SpatialStack-4B 的 54.1 达 8.7 分)、VSI-Bench 73.0(对比 GeoThinker-8B 的 72.6)、SPAR-Bench 76.0(高于 SpatialStack-4B 的 72.0 与 GeoThinker-8B 的 68.2)。 在 ReVSI 七个任务类别中五项取得表中最好结果,包括物体计数 64.9 对 36.3、房间尺寸 66.0 对 54.4、相对距离 71.9 对 62.9。 主结果表覆盖专有模型、开源模型与空间增强模型多类对比;VSI-Bench 分常规与扩展训练两种设置报告,SPAR-Bench 细分结果列于附录。

启示与展望

该结果面向多视图室内场景的空间问答:训练数据来自 ScanNet 的 3D 标注与 LLaVA-Hound、SPAR-7M 等既有子集,评测集中在 ReVSI、VSI-Bench 与 SPAR-Bench,重建精度在 ScanNet 上评估。方法适用于需要定量空间答案(距离、尺寸、计数、最近物体)的场景,并依赖第一帧相机坐标系作为共享参考。对未被几何 CoT 模板覆盖的问题类型(如相对方向),作者保留直接答案监督以维持任务分布覆盖。后续可探索的方向包括把重建增强推理扩展到更广的场景与任务类型。

重建精度在 GT Sim(3) 对齐后与 CUT3R 的差距收窄(SpatialSpeak 5.0 cm 对 CUT3R 4.7/4.6 cm),说明无对齐协议下的优势与对齐后的表现并不完全一致,这一差异在何种下游条件下更关键仍是开放问题。可靠性阈值只在 0.05、0.1、0.2 三个取值上比较,更细的阈值行为未在正文展开。此外,SPAR-Bench 的细分结果与部分定性示例位于附录,正文只给出汇总分数,读者若需逐项判断需查阅附录。

来源