跳到主要内容
返回时间线
arXiv来源发表:

面向双足移动机械臂的整体全身移动操作学习

核心概要

该工作提出一个用强化学习训练的统一全身控制器,仅以单个6自由度末端执行器目标作为任务级指令,直接输出双足底座与六关节机械臂共14个关节的协调动作,在仿真中取得88.30%任务成功率(位置均值误差2.85 cm、P95为5.38 cm),并在真实双足平台上通过VR遥操作、扩散策略与脚本轨迹三种指令源复用同一控制器,将竖直可达范围从浮基加逆运动学基线的约38–163 cm扩展到约3–191 cm。

Source-provided article image: Learning Holistic Whole-Body Loco-Manipulation with a Bipedal Mobile Manipulator
Fig. 1 ·

Fig. 1: Overview of the proposed controller. Given a 6-DoF end-effector target and proprioceptive observations, the policy coordinates whole-body actions through reward-gated training and temporal context estimation.

arXiv

深度剖析

提出并实现以末端执行器为唯一任务指令的双足全身控制接口,控制器自行决定何时仅用手臂、何时需要姿态调整或迈步。 相较需要显式根速度、躯干或步态指令的ULC、CEER等接口,以及用独立策略处理移动的Portela等工作,这里把移动与操作统一到单一6自由度末端目标下,且由单一策略联合控制全部14个关节而非分解上下身。 方法层面给出完整训练管线与可部署输入表(58维观测、9维末端指令、67维上下文),并在真实机器人上以三种指令源无修改复用同一控制器。

提出双足感知的奖励门控:以SE(3)距离调度参考生成连续移动—操作相位系数,配合相位特定安全分数、下界偏移c_s=0.4与best-so-far进度奖励。 在Jiang等RFM基础上,将累积误差项替换为相对历史最优误差的进度奖励,并为安全分数加下界以在恢复阶段保留学习信号。 仿真消融中,与同项同系数的加性奖励相比,成功率由82.73%升至88.30%,位置均值误差由3.23 cm降至2.85 cm,位置P95由14.35 cm降至5.38 cm,动作变化量由0.218降至0.165;但加性奖励的朝向误差更低,显示单项指标与任务级表现之间存在权衡。

提出Transformer–GRU时序上下文估计器,用窗口化注意力加循环记忆并辅以下一步观测预测与速度监督,从本体历史中推断动力学相关信息。 相较无隐变量、DreamWaQ/CENet、仅GRU、仅Transformer等变体,完整估计器在非特权方法中成功率最高。 消融显示无时序上下文成功率降至69.87%、动作变化量升至0.236;完整估计器88.30%,比仅Transformer高3.87个百分点,特权oracle为94.53%作为近似上界;t-SNE与LDA可视化显示隐空间按移动、接近、精细跟踪相位组织且相邻相位连续过渡。

在低成本双足单臂平台上完成系统集成与真实部署,验证统一接口与更大的操作工作空间。 相对浮基加逆运动学基线,控制器无需显式指令底座姿态或移动即可扩展竖直可达范围,并在工作空间边界附近保持更平滑的全身行为。 真实平台为LimX TRON 1双足、ARX L5机械臂、UMI夹爪、Livox Mid-360与Jetson Orin NX,策略50 Hz运行、底层PD 500 Hz;演示包括拾取毛绒玩具并迈步放上货架、擦黑板、扩散策略推关柜门与脚本上下轨迹。

启示与展望

该结果面向双足单臂、14个受控关节的极简平台,控制器以瞬时6自由度末端目标为唯一外部任务指令,训练在Isaac Lab仿真中完成并迁移到真实机器人;其价值在于为VR遥操作、学习策略与脚本轨迹提供共同的执行接口,并扩展竖直可达范围。适用场景是需要在不同高度与位置取放物体、且允许通过下蹲、伸展与迈步来换取可达性的操作任务。

仿真消融在统一目标分布与域随机化设置下比较,真实机器人部分以演示与可达范围对比为主,尚未给出大规模真实任务成功率统计;时序隐空间的可视化显示相邻相位存在重叠,说明相位划分是连续的而非离散类别;作者在结论中指出未来将面向更动态的移动操作行为并提升任务空间跟踪精度,尤其是跟随学习到的高层指令时的精细操作,这些方向的效果仍有待后续验证。

来源