DistScene 把环境当作显式组件:单图生成可分解三维场景,室内场景 CD 相对降低 32.2%
核心概要
DistScene 提出一种从单张图像生成可分解三维场景的框架,把环境与多个独立物体在共享场景坐标系中联合生成,再在局部空间细化每个物体,并通过自动合成渲染场景把预训练物体生成先验蒸馏到场景生成中;在室内与室外基准上,其场景级空间一致性优于所评估的基线。
深度剖析
该工作把环境建模为显式的场景组件,与多个独立物体在共享坐标系中联合生成,从而为物体摆放提供几何上下文。 已有前馈方法多把场景表示为物体实例的集合,不显式建模周围环境,物体布局缺少环境几何约束;DistScene 让环境潜变量充当锚点,耦合各物体潜变量。 消融显示加入环境组件后,MIDI-test 物体 F-score 由 29.98 升至 40.98,包围盒 IoU 由 0.1798 升至 0.2544;Gen3DSR-test 场景 CD 由 0.1367 降至 0.1096,F-score 由 62.04 升至 73.21。
Object-Centric Refinement 在归一化局部空间中、以场景上下文为条件细化每个物体,再放回原场景位置,恢复细粒度几何而不改变整体布局。 物体在全局稀疏体素网格中占比很小,有效分辨率不足;该阶段在同一稀疏体素域内独立细化各物体,并以标记嵌入关联场景潜变量中的对应区域。 消融显示细化使 MIDI-test 物体 CD 由 0.2037 降至 0.1529、物体 F-score 由 40.98 升至 51.64、IoU 由 0.2544 升至 0.3688;去掉场景上下文后各项指标明显变差。
Object-to-Scene Distillation 用自蒸馏数据引擎自动合成可分解场景监督,把预训练物体生成先验迁移到场景生成。 现有场景数据集在规模与物体多样性上受限;该引擎由 LLM 生成结构化场景描述、物体生成器合成物体与环境、再经接触与碰撞检查调整布局,无需现有场景数据集或人工标注。 在 MIDI-test 与 Gen3DSR-test 均为域外的条件下,用该合成数据训练的物体-only 架构在 Gen3DSR-test 上把场景 CD 由 0.1936 降至 0.1367、F-score 由 46.68 升至 62.04。
在室内与室外基准上,DistScene 的场景级空间一致性与物体级几何优于所评估的基线。 室外 UrbanScene3D 上 CD-L1 由 Extend3D 的 0.0832 降至 0.0772、F-score 由 0.680 升至 0.722;室内 MIDI-test 场景 CD 由 3D-Fixer 的 0.1295 降至 0.0877,Gen3DSR-test 场景 CD 为 0.0958、F-score 为 79.68%。 结果来自室内 MIDI-test、Gen3DSR-test 与室外 UrbanScene3D 的定量比较,以及 43 名参与者、20 个文生图输入的匿名用户研究,DistScene 在三项标准上偏好率最高。
启示与展望
该结果面向从单张图像生成可分解三维场景的设定,训练与评测覆盖室内 MIDI-test、Gen3DSR-test 与室外 UrbanScene3D,并包含文生图输入的用户研究。方法以稀疏体素为统一表示,场景生成与物体细化均在该域内完成,因此可直接支持组件级几何输出与物体级编辑;512 分辨率加细化的配置在 5.7 秒场景生成、每个物体 3.3 秒细化与 18.0 GB 峰值显存下提供了效率与质量的折中,适合对速度敏感的场景。对需要显式环境上下文、可分解组件与局部细节的下游任务,如仿真与机器人相关场景构建,这一表示提供了可复用的基础。
室内环境资产在训练中普遍缺少天花板,部分重建可能呈现开顶房间;室外环境空间范围大,有限的场景帧体素被分散到广阔区域,可能丢失细节或出现空洞,且室外训练集规模小于室内。这些属于当前数据生成与表示设定的作用范围,提示后续可关注封闭室内环境资产与大规模场景表示的改进。此外,本次材料为全文解析,若图表细节未完整呈现,则对定性示例与用户研究的具体呈现方式仍可进一步核对。
