分层强化学习让欠驱动双足机器人避障行走:静态98.0%、动态88.0%到达目标,优于A⋆、RRT⋆、APF混合方案
相关研究与后续进展核心概要
该工作提出一种联合训练的两层强化学习框架:高层SAC策略依据机器人位姿、36条射线距离、动态障碍物状态与滚动时域局部目标,每十个控制步输出一次身体速度指令,低层速度条件SAC步态策略通过PD关节目标跟踪该指令;在PyBullet随机化环境中每种方法各100次评测,该方法静态到达率98.0%、动态88.0%,而SAC+A⋆、SAC+RRT⋆、SAC+APF混合方案最高仅78.0%和68.0%,路径长度在A⋆参考值的4%以内,消融显示各观测通道与奖励项均有实质贡献。
Fig. 1: Control paradigms for obstacle-aware bipedal locomotion. Flat RL entangles navigation with gait, decoupled planning ignores balance coupling, and the proposed hierarchy learns a velocity-command policy over a learned velocity-conditioned gait.
arXiv深度剖析
提出并联合训练一个两层HRL框架:高层SAC策略从位姿、36条射线、动态障碍物状态和局部目标输出身体速度指令,低层速度条件SAC步态策略将每条指令执行十个控制步。 与端到端扁平RL直接映射到关节目标、以及将几何规划与独立步态控制器解耦的流水线不同,这里把导航与步态生成分离但保留二者之间的反馈,使有效导航时域缩短十倍。 论文给出两层观测、动作与奖励的完整定义,并说明两层在同一回合中分别以50 Hz与5 Hz更新;训练曲线显示动态障碍条件下收敛更慢,因为策略还需通过TTC项学习速度感知避障。
高层观测与奖励设计同时覆盖静态布局与移动障碍物,其中时间到碰撞(TTC)项诱导提前避让。 相比仅依赖瞬时邻近度的反应式方法与仅在重规划时刻看到移动障碍物的全局规划器,TTC项在邻近度单独触发之前就对预测碰撞施加惩罚。 消融显示,移除动态障碍物速度通道或障碍物位置会严重削弱两种场景的表现,移除TTC或邻近度惩罚也有相当程度的影响,说明提前与近端安全信号互补。
由于收敛后的低层步态与任务无关,可将其冻结并由经典规划器通过同一指令接口驱动,从而构建SAC+A⋆、SAC+RRT⋆、SAC+APF三个受控基线,仅指令生成方式不同。 以往HRL运动研究未将学习到的高层策略与驱动同一学习步态的经典规划器做受控对比,该设计把比较对象限定为导航层本身。 每种方法在静态与动态条件下各100次评测:该方法静态98.0%、动态88.0%成功,全局规划器静态76.0%至78.0%、动态68.0%,APF动态降至55.0%成功且碰撞率45.0%;路径长度7.92 m(静态)与7.90 m(动态)在A⋆参考值4%以内。
对高层观测通道与奖励分量做消融,量化其对成功、碰撞与失败率的影响。 消融把整体优势归因于导航与平衡的耦合结构,而非任何单一奖励项。 移除式(8)姿态项使失败向跌倒转移,移除式(5)塑形裁剪直接使训练失稳(静态90.0%跌倒或超时);各变体的主导失败模式是跌倒或超时而非碰撞。
启示与展望
该结果面向具备已知静态占据地图、八腿关节驱动、无髋或踝滚转关节的欠驱动双足平台,在PyBullet仿真中、目标至少6.0 m远、动态障碍物轨迹事先未知的设定下成立。它使导航层与步态层的联合训练成为一种可复用范式:收敛后的速度条件步态可被冻结,供经典规划器通过同一接口驱动,从而把比较对象限定为导航智能本身。对读者而言,可直接借鉴的是高层观测(位姿、射线、动态障碍物状态、局部目标)与奖励(路径、姿态、安全、正则、终止)的分工,以及用TTC项实现提前避让、用姿态项让导航层对步态可行性负责的思路。
研究为纯仿真,实机迁移需处理模型失配、传感噪声与层间延迟;式(4)中的射线与动态障碍物状态是仿真特权量,替代真实LiDAR与目标跟踪器的效果仍待验证;规划层假设静态地图已知,且该方法与基线对称共享;由于低层步态与高层联合训练,基线复用的冻结步态对其指令的跟踪可能略欠忠实;结果仅用单一训练种子,种子方差未量化;策略只驱动腿部关节,上半身与多接触避障仍开放。此外,原文中若干公式与表格数值在解析文本中缺失(如折扣因子、学习率、缓冲区大小、局部目标前瞻弧长、奖励权重等),因此这些超参数的具体取值无法在此总结中给出。
