ArticuTable 从单张 RGB 图像重建可执行部件级铰接的桌面场景,在 150 张参考图上取得最低 LPIPS 0.2398 与最高 DINOv2 0.8991,用户研究中 85.59% 排名第一
相关研究与后续进展核心概要
该工作提出 ArticuTable 单图桌面场景重建框架:GRAM 用多模态大模型引导的关节拟合与语义状态推理,把不完美的单体代理网格转成可执行 URDF 铰接资产;PSGSR 用点云、俯视、输入视角三阶段渐进配准并结合结构感知语义位姿选择消解偏航歧义;在 150 张生成参考图上,其 LPIPS 0.2398、DINOv2 0.8991、CLIP 0.9265 均优于 ACDC、Gen3DSR、MIDI、TabletopGen,碰撞率 0.3819% 最低,用户研究中 85.59% 排第一,并发布 100 个可直接载入 Isaac Sim 的 USDZ 场景。
Figure 1: Single-image reconstruction of articulated tabletop scenes. Given one RGB image (left), ArticuTable reconstructs an input-view-consistent 3D scene containing rigid and articulated objects. Renderings of the same scene under different joint configurations (right) demonstrate part-level articulation while preserving the arrangement of object instances.
arXiv深度剖析
GRAM 能从图像生成的不完美单体网格中恢复可执行铰接资产,无需铰接专用训练或微调。 既有铰接建模方法多在部件结构清晰、带铰接标注的资产上训练与评测,而图像生成网格常出现部件边界融合、接触几何畸变、内部结构缺失;GRAM 用 MLLM 引导的关节拟合与语义状态推理替代单纯依赖局部几何。 在 Lightwheel 全部 243 个资产上按官方协议评测,GRAM 部件匹配精度 91.15、关节角误差 17.26 度、轴位置误差 0.034,为所评网格条件方法中最好;消融显示 MLLM 引导关节拟合使角误差降低 57.1%、轴位置误差降低 20.9%。
PSGSR 通过点云、俯视、输入视角三阶段渐进配准与结构感知语义位姿选择,恢复与输入视角一致的场景布局。 既有方法直接对输入视角优化位姿与尺度,目标非凸、依赖初始化;PSGSR 让每一阶段由前一阶段估计初始化,并用结构加权双向语义对应为可微细化挑选偏航假设。 消融显示完整模型 LPIPS 0.2398、DINOv2 0.8991、CLIP 0.9265 优于仅点云对齐(0.3439/0.8102/0.9077)与去掉 SASPS(0.2543/0.8762/0.9205);俯视阶段用廉价二维旋转把输入视角搜索限制到残余对称假设,全流程 179.4 秒,而仅前视 SASPS 批处理需 374.8 秒、顺序渲染需 595.3 秒。
在 150 张生成桌面参考图上,ArticuTable 在输入视角一致性、GPT-5 评测与物理有效性上全面领先四个基线。 相对最强基线 TabletopGen,LPIPS 由 0.3935 降至 0.2398,DINOv2 由 0.7788 升至 0.8991,GPT-5 综合分由 5.378 升至 6.240,物体相交率由 1.4488% 降至 0.3819%,含相交场景比例由 16.00% 降至 10.67%。 所有基线共享输入与视角,适用时使用与 ArticuTable 相同的 TRELLIS.2 与 GPT-5;物理有效性在初始场景配置下评测,排除与支撑桌相关的物体对。
作者发布 ArticuTable-100,100 个可直接载入 Isaac Sim 的仿真就绪桌面场景,含视觉网格、碰撞几何与可执行铰接资产。 该集合以自包含 USDZ 包分发,铰接链接使用逐链接 SDF 碰撞体以保留开口容器、内部空腔与通孔等交互相关凹形,而非单一凸包。 包完整性与初始状态检查覆盖全部 100 个场景;在 Isaac Sim 中演示了物体移除、插入、重排,以及重力沉降、工具箱搬运内部物体、搬运后仍可开启的盖子关节。
启示与展望
该结果面向从单张单目 RGB 图像重建桌面场景的设定,适用于物体可被实例分割、桌面可被检测、且存在可合成俯视假设的场景;输出为 URDF 与自包含 USDZ,可直接载入 Isaac Sim 用于物体移除、插入、重排与物理交互。对下游具身操作研究,它提供了含视觉网格、碰撞几何与可执行铰接资产的 100 个场景集合,以及无需铰接专用训练即可把生成网格转为可执行资产的流程。方法依赖 GPT-5、SAM 3、TRELLIS.2、P3-SAM、VGGT 与冻结 DINOv2 等固定预训练组件,未做任务专用微调。
重建场景用估计的针孔相机渲染,其投影模型与参数可能与输入图像不完全一致,强离轴视角下差异在图像边界附近更明显,文中图 7 显示重建杯子的投影倾斜小于输入杯子。场景级指标 LPIPS、DINOv2、CLIP 主要衡量整体图像相似度,局部朝向差异对其影响有限,错误朝向有时反而得分更高,因此这些指标需与定性比较配合阅读。人工审计中 418 个可判定资产有 82.8% 通过,其余为部分通过或失败,失败原因包括运动范围错误、部件分割错误、轴或枢轴不合理、拓扑或关节类型错误、碰撞或脱离、缺失铰接;两位评估者在资产级的一致率为 83.5%,结构分与运动分的二次加权 kappa 分别为 0.474 与 0.659。这些是范围与开放问题:相机参数与物体变换的联合细化、镜头畸变建模,以及在更广泛真实图像上的表现,仍有待后续工作检验。
