伯克利团队提出 Morphometric Imitation:把人类手物交互重定向到三指、四指、五指机器人手,300 次真机试验零样本成功 89.3%
核心概要
该工作提出 Morphometric Imitation 三阶段框架:先用形态优化(MMO)在保持演示接触的前提下把人类手物交互运动学重定向到不同形态的机器人手,再用残差强化学习结合物体位姿与接触信息生成动力学可行的演示,最后蒸馏为视觉运动策略;在三种机器人手和十条 GRAB 轨迹上,MMO 的接触 F1 比五个基线中最强者至少高 8 个百分点,下游动态重定向成功率最多提升 35 个百分点,蒸馏策略在 30 个物体、300 次真机试验中取得 89.3% 零样本成功率。
深度剖析
MMO 通过形态匹配与接触匹配两步,在三种机器人手上都取得最高的位置感知接触 F1 和最低的接触块距离。 以往的运动学重定向多依赖指尖向量约束或接触邻近目标,MMO 改为先把 MANO 手模型缩放到目标机器人手的形态,再逐帧重新优化姿态以恢复因形态改变而偏移的演示接触点。 在 Dex3、Allegro、Sharpa 三种手、每种十条 GRAB 轨迹上,与 DexPilot、AnyTeleop、Position、Contact PyRoki、OmniRetarget 五个基线比较,MMO 在全部三种手上 F1 领先最强基线至少 8 个百分点,接触块距离也更低;论文同时报告了失败调整后的分数与配对自助法区间。
更好的运动学参考会传导到下游动态重定向:在残差 RL 公式与超参数完全固定的条件下,MMO 参考带来更高的任务成功率和更低的接触感知 ADD。 此前工作较少把运动学重定向质量与同一动态重定向公式下的下游表现直接对照,该工作把参考来源作为唯一变量。 每种手、每个物体类别评估 2048 次仿真 rollout,MMO 参考在三种手上成功率与物体轨迹跟踪均最优,相对各手最强基线成功率提升最多 35 个百分点。
残差 RL 中物体位姿与接触信息作用互补:只用物体位姿会偏离演示抓取几何,只用接触信息则物体轨迹跟踪较差,两者结合效果最好。 该工作把物体位姿与接触信息同时写入观测、奖励与终止条件,并做了移除其中之一的消融。 消融显示移除接触信息后三种手成功率下降,再移除物体位姿后进一步下降;论文据此把物体位姿归为任务级运动引导、接触信息归为演示交互锚定。
蒸馏出的视觉运动策略在真机上实现零样本部署,300 次试验成功率 89.3%,且未出现与刚性桌面的硬碰撞失败。 策略不使用任何真实世界训练数据,仅从仿真中带特权状态的教师策略蒸馏,并在透明酒杯等部分可观测物体上仍保持成功。 在 KUKA iiwa14 加 Sharpa Wave 手、RealSense L515 上,对 10 类物体各 3 个物理实例、每个 10 个随机初始位姿共 300 次试验;失败主要来自与位姿相关的定位误差和预抓取张开不足,而非桌面碰撞。
启示与展望
该结果面向以重建手物交互为演示来源、目标为多指机器人手桌面操作的场景:MMO 在单张 RTX 4090 上以每秒 180 帧(单手)和 150 帧(双臂)重定向,残差 RL 每个策略训练 60 至 90 分钟,真机部署在 KUKA iiwa14 加 Sharpa Wave 手与 RealSense L515 上。它使研究者可以在不采集真机数据的前提下,把一段人类演示迁移到三指、四指或五指手上,并直接得到可零样本执行的视觉运动策略;对需要跨类别统一策略、或需要从单目视频直接获取演示的团队,论文把这两点列为下一步方向。
论文自述的边界包括:当前每个物体类别分别训练残差 RL 与视觉运动策略,真机只在一套机械臂与手上验证,演示来自十条动作捕捉轨迹而非单目视频重建,且对更广位姿与形状的泛化仍是待解问题。真机失败集中在与初始位置相关的定位误差和预抓取张开不足,torus 类别因物理实例比 GRAB 参考更薄而明显低于仿真表现,说明各向异性尺度随机化未覆盖这类几何变化。此外,接触评估以网格顶点面积加权、在 5 毫米容差下进行,论文自身提示需要表面重采样收敛性研究才能声称物理标定的毫米级精度;这些都属于范围与开放问题,而非结论的否定。
