跳到主要内容
返回时间线
arXiv来源发表:

GAM 用冻结的 3D 定位骨干替代语言与视频预训练,在 RoboTwin 2.0 随机场景下把成功率从 30.4% 提到 47.6%

核心概要

该工作提出 Grounded Action Model(GAM),以预训练的可提示 3D 定位模型 WildDet3D 作为机器人基础模型骨干,把语言、2D 点或 2D 框提示统一转换为以任务物体为中心的表征(保留目标视觉特征的图像 token 与编码点云、度量位置和尺寸的检测 token),再经多流 transformer(MM-DiT)结合机器人状态历史预测动作块;在 RoboTwin 2.0 的 50 个任务上平均成功率 55.3%(对比 Spatial Forcing 的 52.0%),随机场景下 47.6%(对比 Abot-M0 的 30.4%),在 LIBERO-PRO 的 16 种扰动设置上取得 61% 的平均成功率(对比 53%),在双臂 YAM 上

AI-generated editorial illustration: Grounded Action Model: 3D Grounding as a Foundation for Robotics

深度剖析

提出以 3D 定位作为机器人基础模型预训练目标的新范式,并用 GAM 实例化:策略建立在预训练可提示 3D 定位模型 WildDet3D 之上,不依赖语言生成或视频生成骨干,定位骨干在策略训练期间保持冻结,只训练动作头。 此前主流的 VLA 与 WAM 分别继承语言与视频生成预训练,其目标并不直接要求显式的度量 3D 定位,物体定位需从机器人演示中隐式学得;GAM 把“哪些物体重要、它们在哪里、占据什么几何形状”变成骨干直接输出的显式表征。 论文给出完整方法描述:语言经冻结 Flan-T5 上的 span-tagging 头抽取物体短语,点与框直接指定物体,WildDet3D 输出 2D 框、度量 3D 框与稠密深度图;动作头为 12 层 MM-DiT,用流匹配训练,仅优化动作头。属于方法层面的论证,效果证据见后续基准与真机实验。

统一的任务指定接口:语言、2D 点、2D 框三种提示被映射到同一物体中心表征,使 GAM 既能自主运行,也能作为高层规划器(如 Molmo2)通过点接口驱动的低层控制器,支持长时程与依赖记忆的操作。 以往工作多把语言作为唯一条件,或分别处理几何与语义;GAM 让语义推理与空间控制通过同一 grounded observation 衔接,规划器在子任务切换时更新目标选择,动作策略本身跨子任务保持不变。 在 Franka 上以 Molmo2 规划器通过点接口组合,四个任务(两个长时程、两个依赖记忆)上平均分布内步骤完成率 64.7%,分布外 49.8%,对比 的 42.4%/24.0% 与 MolmoAct2 的 35.3%/17.1%;每任务 20 次分布内与 10 次分布外试验。

在随机化场景与目标重定位/重新指定两类泛化上取得明显优势:RoboTwin 2.0 随机设置 47.6%(对比 Abot-M0 的 30.4%),且动作策略只在干净场景演示上训练;LIBERO-PRO 上 16 种扰动平均 0.61(对比 的 0.53),在 Pos 与 Task 两类改变布局或目标的扰动上增益最大。 基线在保持布局与目标的 Obj、Sem 扰动下仍强,但在 Pos、Task 下普遍跌至 0.11 以下,说明其成功更多依赖对训练布局轨迹的记忆;GAM 的观测由“被定位的对象”定义,目标改变直接反映在输入中。 RoboTwin 2.0 为 50 个任务、每任务 100 次 rollout 的官方单任务协议;LIBERO-PRO 为四个套件、16 种设置,基线数字取自官方排行榜,Flex- 由作者自行评测。GAM 在 Obj 扰动上落后,作者归因于物体尺寸变化会改变合适抓取位置。

消融显示增益来自物体中心过滤与双流互补:去掉图像掩码或点云裁剪使平均成功率从 46.8% 降至 22.3% 与 12.8%,两者都去掉降至 10.3%;只保留检测 token 或只保留图像 token 分别只有 16.0% 与 20.3%。 这区分了“更强的感知骨干”与“如何选择与表示骨干输出”两种解释:所有变体共享同一冻结骨干,因此差异来自观测构造方式;同时说明度量几何与外观信息互补,缺一不可。 在 RoboTwin 2.0 的 10 个任务、每任务 20 次 rollout、Easy 与 Hard 两种设置下评测,骨干、动作头、训练数据与调度保持一致。

启示与展望

该工作面向需要在场景外观变化、目标被移动或被重新指定时仍能操作指定物体的机器人操作策略,适用于仿真基准(RoboTwin 2.0、LIBERO-PRO)与两台真机(双臂 YAM 的双手抓放、单臂 Franka 的长时程与依赖记忆任务)。它使后续工作可以在同一接口下替换定位骨干、接入不同高层规划器,或把 3D 框换成更细粒度的几何表示;对希望把语义规划与空间控制衔接起来的研究者与工程团队,论文给出了可复现的观测构造与训练配方(冻结骨干、只训动作头、流匹配)。

论文自述 GAM 依赖定位观测的质量与完整性:定位错误会直接传播到动作且没有恢复机制,物体中心过滤也可能漏掉未被选中的障碍物等上下文。作者提出需要更多样的 3D 定位数据与跨物体、跨场景泛化的模型,并计划探索稠密 3D 实例分割等更细粒度表示、定位感知的失败恢复与自适应上下文选择。读者还会关注:在 Obj 扰动(物体外观与尺寸变化)上 GAM 落后于部分基线,作者解释为策略可能难以调整对训练中未见过尺寸的抓取动作;这一解释在更多物体尺寸与形状变化下的适用范围,以及定位骨干在新域单独微调的成本,都是后续可观察的问题。

来源