Mira-Scene 用像素对齐的规范坐标图替代稀疏位姿回归,在 BlendSwap 上把 3D-IoU 从 0.520 提到 0.727
核心概要
Mira-Scene 提出一种组合式单图三维场景重建框架,用像素对齐的规范坐标图(CCM)与单目几何估计得到的场景点云图(PCM)构成稠密且有界的对应关系,再通过鲁棒几何对齐恢复物体变换,并用多模态扩散 Transformer 联合生成物体几何与 CCM;在室内、室外、合成与真实场景上,其布局精度优于强基线,在 BlendSwap 上相对 SAM3D 取得 39.8% 的 3D-IoU 与 16.5% 的 2D-IoU 相对提升,且仅使用有限的开源训练数据。
深度剖析
论文把物体布局从稀疏、无界的位姿变量改为稠密、有界的对应关系恢复:CCM 把每个可见物体像素映射到物体有界规范空间中的表面坐标,与单目几何估计得到的场景空间 PCM 配对后,每个有效像素都提供一条规范空间到场景帧的对应,物体变换由鲁棒几何对齐而非神经位姿回归得到。 此前组合式方法通常把布局参数化为平移、旋转、缩放这类稀疏无界位姿变量,整体式方法则把布局吸收进场景级生成过程;论文指出稀疏位姿在遮挡、透视歧义和长尾配置下难以回归,而场景级监督稀缺。CCM 把预测目标放在有界规范空间,因此可以直接用可扩展的物体级三维数据监督,不需要场景级布局标注。 消融实验(Tab. 4)在同一几何-布局联合生成架构下比较三种表示:Raw 的 3D-IoU 为 0.365、Coord Cube 为 0.379、CCM with PCM 为 0.727,2D-IoU 相应为 0.358、0.381、0.783;论文说明 Coord Cube 只是把场景空间预测稠密化,仍是无界目标,因此提升有限。在匹配训练数据的对照中,CCM with PCM 仍以 0.537 的 3D-IoU 和 0.662 的 2D-IoU 优于 Raw 与 Coord Cube。
论文提出一个几何-布局联合生成模型:采用 Mixture-of-Transformers 设计,几何专家在三维体素潜空间生成物体几何,布局专家在像素空间生成 CCM,两条模态专用流通过共享自注意力交换信息,并把几何 token 与布局 token 嵌入同一个三维位置空间。 论文称这是首次在 Mixture-of-Transformers 架构中同时去噪三维潜空间中的物体几何与二维图像空间中的像素对齐规范坐标图;相比简单拼接 token 或完全分离的模型,该设计保留两种模态各自的结构,同时利用形状与布局之间的强依赖。 架构消融显示,去掉联合注意力使 2D-IoU 从 0.757 降到 0.535、CD 从 0.017 升到 0.070;去掉共享位置编码带来较小但一致的下降(2D-IoU 0.747、CD 0.019)。论文用预测 CCM 诱导的点云与生成网格的一致性来衡量几何-布局一致性,并说明 Ours-(CCM+Mesh) 的强结果应理解为两个生成输出之间的内部一致性,而非高于真值网格的保真度。
在完整场景重建评测中,Mira-Scene 的物体几何与最强基线相当,而布局精度提升明显:BlendSwap 上 3D-IoU 从 SAM3D 的 0.520 提升到 0.727,2D-IoU 从 0.672 提升到 0.783;3D-Future Scene 上 3D-IoU 从 0.596 提升到 0.694。 论文强调 SAM3D 受益于更大规模的数据引擎和显著更多的物体级训练数据,而 Mira-Scene 只使用 60K 开源物体资产;在物体几何上 Mira-Scene 在 BlendSwap 的 CD(0.021 对 0.027)与 F-score(0.843 对 0.817)上略优,在 3D-Future Scene 上则略逊(CD 0.015 对 0.014,FS@0.1 0.845 对 0.866)。 定量结果来自 Tab. 1,覆盖 BlendSwap 与 3D-Future Scene 两个基准,指标包括 CD、FS@0.1、EMD、3D-IoU、ICP-Rot、2D-IoU、ADD-S;所有方法接收同一场景 RGB 图像与实例掩码,以排除分割质量差异,并使用相同的归一化协议与对齐流程。论文还报告在遮挡分组下 3D-IoU 从大部分可见物体的 0.752 降到重度遮挡物体的 0.635。
论文把 CCM 与 CUPID 这类同样建模三维-二维对应的方法做了方向性对比:CUPID 近似前向渲染,为每个三维体素中心存储其投影像素坐标;Mira-Scene 近似反向渲染,直接为每个二维像素记录三维坐标,从而把一对多映射变为一对一映射,减少对应歧义。 论文指出 CUPID 可借 PnP 求解器恢复相机位姿并对齐三维物体与二维图像,但场景生成需要准确的二维像素到三维点对应来关联图像观测与点云图;此外从二维语义特征预测二维 token 的三维坐标,比从同一特征预测三维 token 的二维坐标更容易。 在 CUPID 协议下的对应评测中,CUPID-(Mesh+GT) 的 2D-IoU 为 0.802、CD 为 0.047、FS@0.01 为 0.414、FS@0.05 为 0.727;Ours-(Mesh+GT) 的 2D-IoU 为 0.795,但 CD 为 0.023、FS@0.01 为 0.456、FS@0.05 为 0.885。论文说明 CUPID 的 2D 掩码 IoU 略高,而 Mira-Scene 的 CD 与 F-score 明显更好。
启示与展望
该结果面向单图组合式三维场景重建:输入为一张 RGB 图像与实例掩码,输出为一组带位姿的物体资产,物体几何在规范空间生成,布局通过 CCM 与 PCM 的稠密对应经鲁棒几何对齐恢复。论文报告其适用于室内、室外、合成与真实场景,并在 3D-Future Scene 与 BlendSwap 两个基准上评测,其中 BlendSwap 覆盖室内外与写实、卡通风格,被用作跨域泛化的主要基准。方法的价值在于把布局学习从稀缺的场景级标注中解放出来,使物体级三维资产可以规模化地用于预训练;论文的预训练使用 60K 个 Objaverse 物体与 1M 物体中心视图,另加 20K 张背景补全的写实物体视图,微调使用 20K 张 3D-FRONT 场景视图。下游用途包括对重建场景中的单个物体进行移除、重定位、重配置、绑定与动画,以及导出到交互式编辑工具、具身智能仿真器和物理引擎用于感知、规划、操作或物理仿真。当掩码未提供时,论文使用基于 SAM3 的 VLM 引导分割流程获取可见实例掩码,但定量比较均使用真值实例掩码。
论文在附录 F 中列出若干开放问题:当前流程逐物体独立处理,物体彼此靠近或生成几何不够准确时可能出现自相交,例如猫尾与椅子相交;方法需要 RGB 图像与对应物体掩码,而真实图像中掩码常含噪声并导致漂浮物,降低对掩码的依赖仍是未来方向;方法主要学习二维-三维对应,全局场景几何依赖单目几何估计,对部分二维卡通风格图像可能产生薄片状点云;当前训练数据量显著小于 SAM3D 等模型,单物体生成质量相对较弱。此外,评测中 3D-Future Scene 因掩码质量参差只选取了 50 个样例,BlendSwap 与 SceneMaker 的对比按至多 5 个物体每场景的设置进行,这些范围会影响结论可外推的边界。论文的定量结果使用真值实例掩码,因此自动分割流程对最终布局精度的实际影响仍需读者结合自身场景判断。
