跳到主要内容
返回时间线
arXiv来源发表:

OTRetarget 用最优传输把人类演示中的接触关系搬到 G1 人形机器人身上,机器人—物体交互 Jaccard 达 87%

核心概要

OTRetarget 提出一种联合重定向方法,用带符号距离、最近表面点和相对方向刻画表面交互,并通过熵正则最优传输把这些量在人体、机器人和物体几何之间迁移,再放入逐帧约束逆运动学中同时优化机器人与物体位姿;在 OMOMO 上机器人—物体交互 Jaccard 为 87%、深度误差 8.7 mm,对比 OmniRetarget 的 28% 与 29.3 mm,并在真实 Unitree G1 上完成双手搬箱放到桌面的任务。

AI-generated editorial illustration: OTRetarget: Joint Robot and Object Motion Retargeting via Optimal Transport

深度剖析

方法把交互表示为表面级邻近三元组(带符号距离、最近点、相对方向),并作为逐帧约束逆运动学中的交互残差,与运动风格目标一起优化。 此前基于骨架点的重定向只能部分描述支配接触的表面交互,交互网格方法把交互精度与姿态耦合在单一度量中;这里把交互残差与风格目标分开表达。 论文给出残差定义、探针采样密度(物体 1000 pts/m²、人体与机器人 2000 pts/m²)与权重设置,并在 AMASS 与 OMOMO 上与 OmniRetarget、GMR、PHC 对比。

把物体位姿当作决策变量,与机器人位姿联合优化,从而在不缩放场景与演示的前提下同时处理机器人—物体、物体—物体和地面交互。 既有关系型方法把物体位姿当作输入而非自由变量,OmniRetarget 只求解机器人并按身高比全局缩放演示;这里让物体轨迹随目标本体自适应。 表 II 显示在 OMOMO 上固定物体略微恶化风格与地面接触,放开物体后两者恢复且漂移小于 1 cm;在 overhead lift 案例中固定物体使风格误差翻倍并抬起脚,可变物体平均移动约 12.2 cm 到可达高度。

把用于人体—机器人对应的最优传输扩展到演示物体与替代物体之间,使单次演示可迁移到未见过的物体形状与尺寸。 此前交互迁移多针对静态伙伴或固定物体;这里用同一套传输框架映射交互目标,并保留目标的度量含义而不缩放。 表 IV 用八种未见形状替换扫描箱子,召回率与精度接近原生箱子,深度误差保持在约 12 mm 以内;物体缩放实验中抓取召回率几乎不变,而 OmniRetarget 在较小箱子上召回率崩塌。

在 OMOMO 上机器人—物体交互 Jaccard 达 87%、深度误差 8.7 mm,优于 OmniRetarget 的 28% 与 29.3 mm;用重定向参考训练的全身体策略迁移到真实 G1,完成双手搬箱放到桌面。 论文同时报告交互保真度、运行时间、物体泛化与硬件迁移,并指出交互残差而非原生场景或可变物体是主要增益来源。 表 III 给出 OMOMO 4421 条序列的中位数结果,缩放且固定物体的消融仍保留大部分增益;硬件部分为单机器人、单段演示,作者自述这不是硬件研究。

启示与展望

该结果面向从人类演示生成人形机器人全身 loco-manipulation 参考轨迹这一环节,适用于平地、单一机器人(29 自由度 Unitree G1,固定手)以及单次双物体采集的场景;方法为运动学、逐帧求解,不显式建模力,也不在时间跨度上优化,因此作者把更复杂地形与场景列为后续方向。对读者而言,这意味着它可作为重定向阶段的交互保真工具,并可与动力学恢复类方法互补。

作者自述评估仍限于单一机器人、平地与单次双物体采集,且方法为运动学、逐帧、不显式建模力或做时间跨度优化;硬件部分为单机器人单段演示,作者明确说明这不是硬件研究。此外,加载文本中部分公式与表格数值以占位形式出现,摘要与正文中的若干具体数字(如运行时间、部分误差值)在正文里未完整呈现,读者若需精确数值应查阅原文表格。

来源