Imagine3D-LLM 让多模态大模型先“想象”出紧凑 3D 场景再作答,在 SPAR-Bench 上以 7B 规模取得 68.5 平均分
核心概要
该工作提出 Imagine3D-LLM:在图像 token 之后追加一小组可学习的 Gaussian summary token,将其解码为紧凑的 3D Gaussian Splatting 表示,并用光度重建损失与标准下一 token 预测联合训练,使多视图多模态大模型在作答前先组装一个粗略的 3D 场景表示;在七个空间推理与 3D 场景理解基准上一致优于此前方法,SPAR-Bench 平均分达 68.5,超过最强空间感知基线 3DThinker-7B 5.2 分。
深度剖析
模型在图像 token 之后插入一小组可学习的 Gaussian summary token,由 LLM 中间层(第 14 层)的隐状态经三层 MLP 解码为 3D Gaussian Splatting 参数,每个 token 解码多个高斯,总计 2592 个高斯,并以可微光栅化渲染回输入视角、用光度重建损失监督。 此前注入 3D 感知的路线要么强化像素级跨视图对应,要么融合 3D 几何基础模型特征;这里改为让 MLLM 自己组装一个紧凑的、物体级的 3D 表示,并让答案条件于该表示。 论文给出完整方法推导与实现细节(基于 LLaVA-Video-7B,每图 210 个 token,32 张输入图,解码层为 28 层中的第 14 层),并报告渲染质量 PSNR 17.61、SSIM 0.74、LPIPS 0.49,低于教师模型 ZipSplat 的 20.60/0.76/0.44,作者说明重建保真度并非设计目标。
由于 summary token 数量远少于图像 token,形成信息瓶颈,迫使跨视图重复出现的内容被合并到共享 token 中;对训练后的 summary token 做 K-means 聚类后可视化其解码高斯,单个簇能稳定定位同一物体(如椅子),且未使用任何聚类或物体级监督。 这一“涌现的物体级分组”把瓶颈设计从工程取舍变成了可观察的机制,呼应论文所引的人类空间推理描述:先跨视图识别共同物体,再推断视角间相对几何,最后拼出粗略 3D 布局。 证据来自聚类可视化与注意力可视化,属于定性分析;论文同时给出定量探针:在 SQA3D 评估集的 ScanNet 场景上做无监督语义分割,图像特征 mIoU 从基线 26.54 提升到 35.43,接近 DINOv3 的 37.62。
重建监督只施加在 summary token 上,却使 LLM 自身的图像特征更具 3D 感知:跨视图注意力更锐利,PCA 可视化显示特征按语义组织、同一物体在不同视角编码一致;按 3DRS 协议用 ScanNet 点云体素化构造跨视图 token 对,中间层对应度分数随训练持续上升。 此前跨视图对应通常靠显式监督(如 3DRS 的对应蒸馏)获得,这里表明它可以从“学会重建”中自然涌现,而无需直接优化。 对应度分析为定量探针(平均余弦相似度),注意力与 PCA 为定性可视化;论文指出提升集中在围绕高斯解码层的中间层。
在七个基准上一致提升:SQA3D EM 63.8、Real-3DQA EM 39.2、ScanQA CIDEr 109.3、Scan2Cap ROUGE 67.6、ScanRefer Acc@0.25 62.8、Multi3DRefer F1@0.25 60.2,SPAR-Bench 平均 68.5(低/中/高分别为 60.5/67.0/76.0),超过 3DThinker-7B 5.2 分,并超过 72B 规模的 Qwen2.5-VL 逾 29 分。 与共享同一骨干、训练数据与调度但不含 summary token 与重建/蒸馏目标的对照基线相比,各基准均提升,说明增益来自该目标而非额外数据;消融还显示直接喂入教师 token 或仅用蒸馏监督都停留在基线水平。 对照实验覆盖六个 ScanNet 系基准与 SPAR-Bench,并包含解码层选择(第 7/14/21 层)、summary token 数量(1296/2592/5184)、蒸馏与训练轮数等消融;训练成本方面峰值显存从 40GB 升至 44GB,推理 20.43GB、176.9ms,低于融合外部 CUT3R 特征的 VLM3R-7B(25.29GB、344ms)。
启示与展望
该结果面向以多视图图像为输入、需要空间问答、情境推理、3D 密集描述与指代定位的通用多模态模型,训练与评测集中在 ScanNet 系室内场景及 SPAR-Bench,输入为每场景 32 帧(SPAR 子集含 2、3 或 32 视图)。它使后续工作可以在不引入推理期外部 3D 模型的前提下,把紧凑 3D 重建作为归纳偏置嵌入 MLLM;教师模型仅在训练期使用,可替换为其他 token 级前馈 3DGS 框架,高斯解码头只在显式需要重建时调用。
重建保真度低于教师模型,论文明确说明高保真渲染并非目标,因此“重建质量”与“推理增益”之间的关系仍是开放问题。训练效率方面,无教师时收敛更慢,蒸馏主要起加速作用。表示预算固定,室内场景未构成约束,但更大更复杂的户外场景是否需要更多高斯与动态调整 token 数量尚待验证。此外,本文所依据的文本包含正文、附录与消融表格,但部分可视化(注意力图、PCA、聚类高斯、渲染视图)以图像形式呈现,仅能通过文字描述了解其结论。
