跳到主要内容
返回时间线
arXiv来源发表:

PatternDex 用物体决定的手–物交互模式引导双臂灵巧手操作,Allegro 成功率从 52.2% 提升到 92.8%

相关研究与后续进展

核心概要

PatternDex 从人–物演示中学习一种与手部形态无关的“交互模式”令牌序列,再结合目标机器人手描述解码出适配该手的腕部运动与接触点,并用其引导强化学习策略;在 ARCTIC 数据集的 6 个未见演示上,Allegro 手平均成功率达 92.8%(基线 ObjDex 为 52.2%),冻结模式编码器仅微调后迁移到 Shadow、Paxini、XHand 三种手仍分别达 84.0%、73.5%、71.6%,并在真实微波炉开门任务中 10 次试验成功 7 次。

Source-provided article image: PatternDex: Learning Interaction Patterns to Guide Reinforcement Learning of Bimanual Dexterous Manipulation of Articulated Objects
Fig. 4 ·

Fig. 4 : Qualitative results of the guided policy. (a) Guided by the estimated wrist motions and contact points shown in the top row, Allegro hands open the microwave, the laptop, and the notebook. (b) Shadow, Paxini, and XHand hands succeed on the same tasks with the interaction pattern transferred from the Allegro hand.

arXiv

深度剖析

提出“交互模式”这一潜在表示:把期望物体轨迹与实现它的腕部运动之间的关系编码为令牌序列,每个令牌编码某一帧腕部相对物体的平移与旋转。 此前的人–物运动相关工作(如 OMOMO、CAMS)生成的是人手运动,未用于不同形态的机器人手;PatternDex 把该相关性显式表示为与手部形态无关的令牌序列。 编码器由空间 MLP 与带自注意力头的时序网络组成,在 ARCTIC 的 229 个人–物演示上训练;四种结构不同的机器人手上模式一致性(人腕与预测机器人腕逐帧位移的 Pearson 相关)均超过 96%,Allegro 为 96.5%,Shadow 为 99.1%。

设计引导预测器:将交互模式与机器人手描述(如 URDF 中的关节数与连杆长宽)结合,估计适配目标手的腕部运动与接触点。 与把机器人腕直接放在人手腕位姿的做法不同,该方法按目标手结构估计腕部位置;与逐指映射的运动学重定向不同,它不要求人手与机器人手逐指对应。 腕部偏移随手部结构而非整体尺寸变化:Allegro 与 Paxini 约后移 5 cm,Shadow 与 XHand 约后移 2.8 cm;四种手的接触点精度(估计接触点与人手接触点重叠)为 74–80%。

用估计的腕部运动与接触点引导 PPO 策略训练,使策略在目标机器人可执行的范围内探索,从而提升双臂灵巧操作关节物体的成功率。 相比仅用人腕轨迹引导的 ObjDex,加入按目标手估计的腕部位置与接触点后,策略不再模仿对该手不可行的动作。 在 6 个演示、两个 Allegro 手配 xArm6 的对比中,ObjDex 平均成功率 52.2%,仅用估计腕部运动为 58.1%,同时用腕部运动与接触点达 92.8%;每回合跟踪 500 步参考轨迹,成功判据为位置、旋转与关节角均在 10 cm/相应角度内且手与臂无碰撞。

交互模式可跨手部形态复用:冻结模式编码器、仅微调预测器与策略即可适配新手,且仿真训练的策略可迁移到真实机器人。 此前方法通常需要为每个机器人手重新训练或依赖遥操作数据;这里只需简单微调,且新任务只需一段人类演示视频。 以 Allegro 训练后冻结模式编码器,Shadow、Paxini、XHand 平均成功率分别为 84.0%、73.5%、71.6%;真实实验中用 CoTracker3 与 HaMeR 从单段视频提取物体与腕部轨迹,Allegro 在 100 步内把微波炉门角从初始值增大,10 次试验成功 7 次。

启示与展望

该结果面向从人–物演示学习双臂灵巧手操作关节物体的设定:输入为物体状态(位姿、关节角、形状)与人手状态,以及目标机器人手描述;输出为适配该手的腕部运动与接触点,并据此训练 PPO 策略。评测在 Isaac Gym 中完成,使用 ARCTIC 的 229 个演示训练、6 个未见演示测试,任务涵盖 Box、Espresso、Laptop、Microwave、Mixer、Notebook;真机验证为 Allegro 手配 xArm6 打开微波炉。适用对象是希望用少量人类演示为不同机器人手快速获得操作策略的研究者与工程团队,尤其是手部尺寸或结构与人不一致、逐指重定向不可行的场景。

跨手迁移在个别物体上差异明显(如 Paxini 在 Mixer 上为 12.6%,XHand 在 Notebook 上为 37.3%),提示迁移效果可能依赖物体与手型的匹配程度,这一依赖关系值得进一步刻画。真机验证目前仅覆盖微波炉开门这一任务、10 次试验,更多物体类别与更长任务时域下的表现仍是开放问题。此外,预测器训练依赖按既有方法重定向得到的腕部运动与接触点作为监督,这些监督信号的质量对结果的影响尚待更系统的考察。评测中重定向类方法因重置方式不同而未纳入同一对比,因此 92.8% 与 52.2% 的差距应理解为与该特定基线在相同初始位姿设定下的比较。

来源