跳到主要内容
返回时间线
arXiv来源发表:

Imagine3D-LLM 让多模态大模型先“想象”出紧凑 3D 场景再作答,在 SPAR-Bench 上以 7B 规模取得 68.5 平均分

核心概要

该工作提出 Imagine3D-LLM:在图像 token 之后追加一小组可学习的 Gaussian summary token,将其解码为紧凑的 3D Gaussian Splatting 表示,并用光度重建损失与标准下一 token 预测联合训练,使多视图多模态大模型在作答前先组装一个粗略的 3D 场景表示;在七个空间推理与 3D 场景理解基准上一致优于此前方法,SPAR-Bench 平均分达 68.5,超过最强空间感知基线 3DThinker-7B 5.2 分。

AI-generated editorial illustration: Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

深度剖析

模型在图像 token 之后插入一小组可学习的 Gaussian summary token,由 LLM 中间层(第 14 层)的隐状态经三层 MLP 解码为 3D Gaussian Splatting 参数,每个 token 解码多个高斯,总计 2592 个高斯,并以可微光栅化渲染回输入视角、用光度重建损失监督。 此前注入 3D 感知的路线要么强化像素级跨视图对应,要么融合 3D 几何基础模型特征;这里改为让 MLLM 自己组装一个紧凑的、物体级的 3D 表示,并让答案条件于该表示。 论文给出完整方法推导与实现细节(基于 LLaVA-Video-7B,每图 210 个 token,32 张输入图,解码层为 28 层中的第 14 层),并报告渲染质量 PSNR 17.61、SSIM 0.74、LPIPS 0.49,低于教师模型 ZipSplat 的 20.60/0.76/0.44,作者说明重建保真度并非设计目标。

由于 summary token 数量远少于图像 token,形成信息瓶颈,迫使跨视图重复出现的内容被合并到共享 token 中;对训练后的 summary token 做 K-means 聚类后可视化其解码高斯,单个簇能稳定定位同一物体(如椅子),且未使用任何聚类或物体级监督。 这一“涌现的物体级分组”把瓶颈设计从工程取舍变成了可观察的机制,呼应论文所引的人类空间推理描述:先跨视图识别共同物体,再推断视角间相对几何,最后拼出粗略 3D 布局。 证据来自聚类可视化与注意力可视化,属于定性分析;论文同时给出定量探针:在 SQA3D 评估集的 ScanNet 场景上做无监督语义分割,图像特征 mIoU 从基线 26.54 提升到 35.43,接近 DINOv3 的 37.62。

重建监督只施加在 summary token 上,却使 LLM 自身的图像特征更具 3D 感知:跨视图注意力更锐利,PCA 可视化显示特征按语义组织、同一物体在不同视角编码一致;按 3DRS 协议用 ScanNet 点云体素化构造跨视图 token 对,中间层对应度分数随训练持续上升。 此前跨视图对应通常靠显式监督(如 3DRS 的对应蒸馏)获得,这里表明它可以从“学会重建”中自然涌现,而无需直接优化。 对应度分析为定量探针(平均余弦相似度),注意力与 PCA 为定性可视化;论文指出提升集中在围绕高斯解码层的中间层。

在七个基准上一致提升:SQA3D EM 63.8、Real-3DQA EM 39.2、ScanQA CIDEr 109.3、Scan2Cap ROUGE 67.6、ScanRefer Acc@0.25 62.8、Multi3DRefer F1@0.25 60.2,SPAR-Bench 平均 68.5(低/中/高分别为 60.5/67.0/76.0),超过 3DThinker-7B 5.2 分,并超过 72B 规模的 Qwen2.5-VL 逾 29 分。 与共享同一骨干、训练数据与调度但不含 summary token 与重建/蒸馏目标的对照基线相比,各基准均提升,说明增益来自该目标而非额外数据;消融还显示直接喂入教师 token 或仅用蒸馏监督都停留在基线水平。 对照实验覆盖六个 ScanNet 系基准与 SPAR-Bench,并包含解码层选择(第 7/14/21 层)、summary token 数量(1296/2592/5184)、蒸馏与训练轮数等消融;训练成本方面峰值显存从 40GB 升至 44GB,推理 20.43GB、176.9ms,低于融合外部 CUT3R 特征的 VLM3R-7B(25.29GB、344ms)。

启示与展望

该结果面向以多视图图像为输入、需要空间问答、情境推理、3D 密集描述与指代定位的通用多模态模型,训练与评测集中在 ScanNet 系室内场景及 SPAR-Bench,输入为每场景 32 帧(SPAR 子集含 2、3 或 32 视图)。它使后续工作可以在不引入推理期外部 3D 模型的前提下,把紧凑 3D 重建作为归纳偏置嵌入 MLLM;教师模型仅在训练期使用,可替换为其他 token 级前馈 3DGS 框架,高斯解码头只在显式需要重建时调用。

重建保真度低于教师模型,论文明确说明高保真渲染并非目标,因此“重建质量”与“推理增益”之间的关系仍是开放问题。训练效率方面,无教师时收敛更慢,蒸馏主要起加速作用。表示预算固定,室内场景未构成约束,但更大更复杂的户外场景是否需要更多高斯与动态调整 token 数量尚待验证。此外,本文所依据的文本包含正文、附录与消融表格,但部分可视化(注意力图、PCA、聚类高斯、渲染视图)以图像形式呈现,仅能通过文字描述了解其结论。

来源