跳到主要内容
返回时间线
arXiv来源发表:

GATOR 用生成式与智能体框架从随手拍图像重建带纹理的三维物体并恢复场景相对位姿

核心概要

GATOR 是一个生成式与智能体框架,能从一张或多张随手拍图像中恢复带纹理的物体资产及其场景相对位姿:它先用局部模态混合器在跨视角推理前耦合块对齐的 RGB、目标掩码与点图特征,再以文本引导的语义条件通过分阶段适配器生成结构、几何与外观,随后用生成资产初始化多模态智能体,通过观察引导的编辑—渲染—审查循环做结构与纹理精修;在合成物体、杂乱桌面与室内场景上取得较强的几何与外观保真度,并能从稀疏观察中恢复场景相对位姿。

Source-provided article image: GATOR: Generative and Agentic 3D Object Reconstruction From Casual Images
Fig. 1 ·

Fig. 1: Generative and agentic 3D object reconstruction from casual images. Left: Generative model inaccurately fills the strainer’s mesh bowl. GPT-6-Astra struggles with strainer ear position, and simplifies the handle and ear shapes. Our GATOR generates and refines the asset, preserving its shape and mesh. Right: GATOR reconstructs complete, textured, posed objects from real-world tabletop captures and room scans, which are composed using their predicted poses. Project page: https://research.nvidia.com/labs/lpr/gator/

arXiv

深度剖析

提出 GATOR,一个生成式与智能体框架,可从一张或多张随手拍图像重建带纹理的物体资产并恢复其场景相对位姿。 把生成式重建与智能体式精修结合在同一流程中,目标是从稀疏、不确定的观察出发推断被遮挡的表面,而不仅是单视角或稠密视角下的形状估计。 摘要报告在合成物体、杂乱桌面与室内场景上均取得较强的几何与外观保真度,并能在稀疏观察下恢复场景相对位姿。

局部模态混合器在跨视角推理之前耦合块对齐的 RGB、目标掩码与点图特征。 在保留场景上下文的同时把目标物体与其周围环境区分开来,使重建结果与场景对齐而非孤立生成。 该模块为方法描述中的核心设计,摘要将其与场景上下文保留和目标区分直接关联。

文本引导的语义条件通过分阶段适配器为结构、几何与外观生成提供类别名称与物体描述。 用语义线索补充空间线索,并按生成阶段分别适配,而非对所有阶段使用同一条件方式。 摘要说明该条件机制与空间线索互补,并服务于结构、几何与外观三个生成阶段。

生成资产初始化一个多模态智能体,通过观察引导的编辑—渲染—审查循环进行有针对性的结构与纹理精修。 生成结果被用作实例特定的几何与位姿先验,使精修围绕具体实例展开,而不是通用后处理。 摘要描述该循环为观察引导,并指出其用于结构与纹理的定向精修。

启示与展望

该工作面向从一张或多张随手拍图像重建带纹理物体资产并恢复场景相对位姿的场景,适用于合成物体、杂乱桌面与室内环境等摘要所述设置;其价值在于为需要实例特定几何与位姿的下游用途提供资产,摘要提到场景级仿真进一步展示了仿真可用性,因此对仿真与内容创作流程尤为相关。

当前可见文本为摘要,未包含具体评价指标、数据集规模、基线对比细节与失败情形,因此对保真度与位姿精度的量化水平仍需阅读原文确认;此外,编辑—渲染—审查循环的迭代成本与收敛行为、以及文本条件在类别名称缺失时的表现,都是读者可继续关注的问题。

来源