GOTT用可复用跨本体接触获取原语,把灵巧手抓取成功率提升到78.7%并让真实任务成功率从35%升到80%
相关研究与后续进展核心概要
GOTT提出“接近—获取—移动”框架,用同一个跨本体闭环接触获取原语把机器人无关的物体轨迹与接近规格转化为稳定接触,再以位姿条件控制器跟踪物体运动;在仿真中统一策略平均抓取成功率78.7%(对比CrossDex的51.7%),零样本迁移到未见过的Allegro变体达72.1%(仅用Allegro训练的策略为17.2%),真实世界四个任务平均任务成功率80.0%(开环基线均为35.0%)。
Figure 1 : Contact-acquisition training and cross-embodiment policy. (A) The RL policy starts from randomized initial configurations and learns to establish stable contact using local hand-object observations. (B) Padding and binary masks map different hands into a shared observation and action space, allowing one policy to operate across hand embodiments.
arXiv深度剖析
提出可复用的跨本体接触获取原语,把“在哪里接触、如何建立稳定接触”从高层意图中解耦出来。 此前方法要么执行开环抓取,要么把接触获取与轨迹执行联合学习,未把接触获取暴露为可跨高层来源与机器人本体复用的技能。 在9,588个DexGraspNet资产、54,149个物体-尺度-位姿实例上,统一策略平均78.7%优于BODex的38.7%与DRO的40.5%;真实世界三个臂-手平台成功率90%、90%、96%。
用规范化的逐连杆表示让单一策略跨不同手部形态共享,并显示多形态训练带来零样本迁移。 相比CrossDex的共享动作空间重定向方案,逐连杆规范表示在相同奖励与PPO设置下把平均成功率从51.7%提升到78.7%。 在三个未见过的Allegro变体上,三手统一策略平均72.1%,与逐变体oracle的72.2%相当,而仅用Allegro训练的策略仅17.2%,说明迁移来自多形态训练。
闭环接触获取在真实端到端任务中显著优于开环抓取执行。 在感知、VLM可供性推理、未来感知IK选择与轨迹跟踪全部固定的条件下,仅替换接触获取方式即可隔离其贡献。 四个真实任务(清理垃圾、倒芥末、擦白板、使用电钻)各重复10次,GOTT平均任务成功率80.0%,BODex与DRO均为35.0%;DRO在清理垃圾上任务成功率为0/10,原因是刷柄接触松散导致滑脱。
把接触获取与工作空间相关的可达性分离,使同一原语在偏离训练配置时更稳健。 SimToolReal等联合学习接触获取与跟踪的本体特定策略在训练配置附近表现好,但偏离后急剧下降。 在600个仿真回合中,接近SimToolReal训练配置时其成功率0.983、GOTT为0.792;在低于某高度偏移后SimToolReal降至0.002,而GOTT为0.914。
启示与展望
该结果面向刚性物体的桌面操作,适用于需要先建立稳定接触再跟踪物体轨迹的任务,例如清理、倾倒、擦拭与工具使用。它使高层意图来源(未来感知规划、外部模型、人类演示、生成视频、关键点)可以替换,而接触获取原语与跟踪后端保持不变;对希望复用同一低层技能跨手部与臂平台的系统集成者最有价值。
高层规划与接触获取目前是顺序执行的,二者之间更紧密的反馈能否带来对不良接近规格的在线恢复仍是开放问题。轨迹跟踪依赖视觉物体位姿估计,在严重手-物遮挡下可能失效,引入触觉或视触觉状态估计是自然的后续方向。抓取后手-物变换被近似视为固定,扩展到处理该变换变化才能支持拧螺丝等更精细的灵巧操作。此外,真实世界抓取实验每个平台为50次试验,任务实验每任务10次,样本规模有限,跨更多物体与场景的稳定性仍需进一步观察。
