ReCo 用响应一致步态策略与策略感知 MPC 将仿真末端跟踪误差降低约 28%
核心概要
ReCo 将响应一致的强化学习步态策略与策略感知模型预测控制(MPC)耦合:通过响应塑形让策略在随机化动力学下对指令响应一致可重复,再用辨识出的闭环响应模型让 MPC 联合规划运动指令与机械臂动作,从而在仿真基准上把位置与姿态均方根误差(RMSE)相对各自最优基线分别降低 28.7% 与 27.4%,并在真实实验中展示了机载的连续腿式操作,基座与机械臂协同运动。
Fig. 1: Demonstration of continuous legged manipulation tasks in the real world. ReCo jointly plans locomotion commands and arm motions to track task-space end-effector trajectories for object organization, cabinet-door opening, and pick-and-place.
arXiv深度剖析
提出 ReCo 框架,把响应一致的腿式运动策略与策略感知 MPC 结合,用于腿式操作中基座行走时末端执行器的连续跟踪。 相对既有 RL 加 MPC 的组合,本文显式处理了“学习策略的指令响应随步态相位、接触与负载变化”这一环节,使 MPC 能预测并补偿基座运动。 摘要层面给出框架组成与仿真基准结果,未提供消融、样本量或统计检验细节。
响应塑形训练策略在随机化动力学下对指令响应一致且可重复,随后辨识闭环响应模型供 MPC 使用。 把策略响应的一致性作为训练目标,并据此建立可被 MPC 使用的闭环响应模型,而非把策略视为固定黑箱。 摘要陈述了方法步骤,未给出随机化范围、辨识数据量或拟合精度。
MPC 联合规划运动指令与机械臂动作,以补偿跟踪误差。 将基座运动指令与机械臂动作纳入同一规划,而非仅由机械臂被动补偿。 摘要层面的方法描述,未给出规划时域、频率或约束形式。
仿真基准上位置与姿态 RMSE 相对各自最优基线分别降低 28.7% 与 27.4%,真实实验展示机载连续腿式操作与基座—机械臂协同。 在仿真中给出相对最优基线的量化改进,并在真实平台验证机载连续操作。 摘要报告了百分比改进与真实实验存在性,未给出基线清单、试验次数或真实实验的定量指标。
启示与展望
该工作面向需要在基座持续行走时保持末端执行器精确跟踪的腿式操作场景,适用于策略响应会随步态相位、接触与负载变化、且 MPC 需要可预测基座运动的设定。其贡献在于给出可复用的组合方式:先用响应塑形获得一致可重复的指令响应,再以辨识出的闭环响应模型支撑 MPC 联合规划运动指令与机械臂动作。对从事腿式机器人、移动操作与学习控制与 MPC 混合架构的研究者和工程师,这一框架提供了把“策略响应特性”显式纳入规划器的参考路径;仿真基准上的 RMSE 降幅与真实机载演示说明该路径在仿真与真实平台上均可运行。
摘要未说明随机化动力学的范围、闭环响应模型的辨识数据与精度、MPC 的规划时域与频率、基线集合与试验次数,也未给出真实实验的定量跟踪指标。因此,28.7% 与 27.4% 的 RMSE 降幅所对应的具体基线与评测条件,以及真实平台上协同运动的精度水平,仍需查阅正文确认。此外,响应一致性在训练中的实现方式与代价、以及该方法在负载或地形变化下的适用范围,属于读者可继续关注的问题。
