跳到主要内容
返回时间线
arXiv来源发表:

把单人搬物策略蒸馏成可复用低层技能,高层策略据此协调多台人形完成抬沙发、推沙发与四人搬运

核心概要

该工作提出分层框架,把单人物理仿真人-物交互教师策略的成功轨迹重标注为物体代理的短时程位移监督,蒸馏出可冻结复用的“物体导向运动技能”,下游只训练高层策略输出各操作区域的代理运动指令;在Isaac Gym的4096并行环境中,该技能在教师轨迹目标与随机代理运动目标上均取得优于InterPhys与SkillMimic的跟踪精度,并支持两人抬沙发、四人抬H形箱与十字箱、两人与四人推沙发等任务。

Source-provided article image: From Solo to Ensemble: A Hierarchical Framework for Composable Multi-Agent Human-Object Interaction
Figure 1 ·

Figure 1: Our method composes object-oriented motion skills and cooperative planning to support shared object manipulation across team sizes, object geometries, and interaction types.

arXiv

深度剖析

提出以物体代理短时程位移序列作为低层动作空间,把高层协调与接触密集的全身执行解耦。 既有方法(如CooHOI)通过策略初始化或任务特定微调把单人交互策略适配到多人类任务,低层运动技能与高层协调纠缠在同一任务策略中;本文改为让低层技能只负责实现物体代理的近未来运动,高层在紧凑的物体级动作空间中做区域化代理运动规划。 方法层面给出物体导向动作空间与低层策略映射的形式化定义,并在附录中说明代理观测包含顶点、朝向、顶点线速度与角速度,代理运动目标统一转换到接收人形的局部坐标系。

把任务特定单人教师策略的成功轨迹重标注为物体代理运动监督,并配合在线行为克隆与随机代理运动强化学习后训练,得到可复用的物体导向运动技能。 教师目标仅用于在线查询教师动作,学生输入只包含人形状态、物体代理观测与未来代理运动条件,参考人体运动只用于奖励计算而不进入学生输入,从而避免学生退化为全身运动跟踪器。 在教师轨迹目标上,本文位置误差79.8mm、速度误差38.2mm/frame、加速度误差31.3mm/frame²、轨迹目标到达率100.0%、完整轨迹跟随成功率98.9%,优于InterPhys(106.5/47.8/50.9/82.6/68.2)与SkillMimic(91.0/40.3/44.2/90.8/81.2);在随机代理运动目标上本文为95.8/45.2/39.2/96.3/91.8,同样领先。

消融显示两个训练阶段各自承担不同作用:在线蒸馏提供可行交互先验,随机代理运动后训练扩展可执行运动范围。 去掉在线蒸馏后随机目标上完整轨迹成功率降至23.8%,说明仅靠物体代理跟踪奖励不足以从零启动接触密集的搬运;去掉随机运动后训练后教师轨迹目标仍保持97.2%到达率与98.1%完整轨迹成功率,但随机目标上完整轨迹成功率降至38.7%。 两组消融在同一目标接口与同一评测指标下与完整方法对比,覆盖教师轨迹目标与随机代理运动目标两种分布。

冻结技能后仅训练高层策略,即可在物体几何、交互类型与团队规模上迁移。 技能仅从单人搬运蒸馏,却支持两人与四人推沙发,说明交互模式迁移只需更换高层策略;单人扶手椅/桌子搬运与大型箱体推动进一步验证几何迁移。 在4096并行环境、15刚体28个PD控制关节的人形模型上报告成功率与精度:两人抬沙发88.21%对CooHOI的84.17%,四人抬H形箱85.63%对80.96%,四人抬十字箱86.14%对82.38%;推动任务CooHOI未覆盖,本文报告单人推大箱96.24%、两人推沙发94.98%、四人推沙发88.14%。

启示与展望

该框架面向可复用物体导向运动技能内的组合式人-物交互:高层策略通过共享低层执行器协调局部代理运动。适用于以长方体代理表示物体或任务相关局部区域、且操作区域可按物体几何与交互角色预先分配的场景,例如家具搬运与推动;技能学习阶段还把箱体尺寸在标称尺度附近随机化以扩大几何覆盖。对希望复用已有单人交互策略、又需要扩展到不同物体几何、交互类型与团队规模的研究者与工程团队,这一接口可直接作为下游高层策略的动作空间。

作者指出该框架未显式处理异构技能类型之间的组合,也未处理长时程时间结构,例如多阶段任务分解与动态角色重分配,并把技能级组合与更高层规划列为未来方向。读者还可关注:随机代理运动目标由程序化生成器产生,其覆盖范围与真实下游高层策略输出的分布之间的关系尚待进一步刻画;推动任务缺少CooHOI对照,跨交互模式的比较目前来自本文自身结果;附录中的表格与公式在本次解析中部分数值与符号缺失,若需复现具体超参数与奖励权重,应回到原文附录核对。

来源