单张图像生成完整三维场景网格:自适应分块与显式二维—三维条件让室内外重建超越全部基线
核心概要
该工作改造以物体为中心的三维生成器 Trellis 2,用随相机距离变化的自适应分块、把图像特征提升到可见表面并区分自由空间与遮挡区的显式二维—三维条件,以及约 4000 个合成室外场景的监督,从单张图像生成完整场景网格;在 Tanks and Temples、ScanNet++ 与 121 张野外图像上,几何精度与感知质量均优于全部基线。
深度剖析
提出自适应场景分块表示:近处用较小分块保留细节,远处或较高结构用较大分块扩大覆盖,使一个在规范体积上训练的生成器能覆盖不同尺度的场景。 相比把整场景压入单一固定分辨率体积,或使用统一物理尺寸的重叠分块(如 GenRecon),该方法按深度与局部高度逐行放大分块尺度。 消融显示自适应分块在室内与室外重建指标上均最好,且比固定 3 米分块快三倍;在延伸至约 200 米深、100 米高的大场景中,固定尺寸分块约需 200 个分块而超出单张 A100 80GB 显存,自适应策略仅用 4 个深度区域、15 个分块,约 5 分钟完成推理。
提出显式二维—三维条件:用单目点图把 DINOv3 图像特征仅提升到观测表面,并以截断符号深度残差编码每个三维 token 位于表面前方自由空间、表面上还是后方未知区域。 不同于让所有三维 token 通过交叉注意力共享图像特征,或把点图 token 化、直接反投影图像特征的做法,该方法利用自适应分块中已知的 token 位置直接建立对应关系。 在室内与室外验证集上,该条件优于 SAM 3D 风格与仅投影条件;定性观察显示后两者更常产生重复表面并漏掉遮挡区域几何。
构建约 4000 个多样室外场景作为额外训练监督,并发现用这些并非完美重建的合成场景训练反而提升模型性能。 现有场景数据集以室内为主,室外数据多样性受手工规则限制;该工作用智能体流程从 20 类室外场景生成参考图像、物体网格、地形与布局。 在固定条件机制下,加入室外数据后室内与室外重建均改善,室外增益更大;训练后的模型比用于构造其训练数据的合成流程产生更细几何并更好保持输入布局。
在 Tanks and Temples、ScanNet++ 与 121 张野外图像上,方法在几何精度与感知质量上超过全部基线。 与迭代三维补全、物体组合、先生成视频再重建、直接场景重建四类共七个基线相比,该方法在每项指标上均领先。 Tanks and Temples 上 Chamfer 距离较最强基线降低 24%、F1 提升 30%;野外图像上在至少 73% 的成对用户研究比较中被偏好。
启示与展望
该方法面向从单张图像生成室内与室外场景网格,适用于内容创作、虚拟现实以及为物理模拟器与机器人学习提供可探索三维世界等设定;其分块分配依赖估计的点图与相机内参,训练与推理流程在公开的 Trellis 2 与 MoGe-3 之上构建,因此适用于具备单目几何估计能力的图像输入。作者指出未来工作将探索带纹理的输出。
方法生成的是无纹理几何,且继承 Trellis 2 不保证水密网格的特性,偶尔产生需要额外处理的孔洞;结果依赖估计深度与相机内参,其误差会影响分块放置、场景尺度与特征对齐;自回归生成可能通过复用的重叠潜变量把早期分块的误差传播到后续分块。此外,合成室外场景本身并非完美重建,其形状与布局偏差对监督质量的影响仍是开放问题。
