跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

分层强化学习让欠驱动双足机器人避障行走:静态98.0%、动态88.0%到达目标,优于A⋆、RRT⋆、APF混合方案

该工作提出一种联合训练的两层强化学习框架:高层SAC策略依据机器人位姿、36条射线距离、动态障碍物状态与滚动时域局部目标,每十个控制步输出一次身体速度指令,低层速度条件SAC步态策略通过PD关节目标跟踪该指令;在PyBullet随机化环境中每种方法各100次评测,该方法静态到达率98.0%、动态88.0%,而SAC+A⋆、SAC+RRT⋆、SAC+APF混合方案最高仅78.0%和68.0%,路径长度在A⋆参考值的4%以内,消融显示各观测通道与奖励项均有实质贡献。