BVER 双向 Voronoi 偏置课程让无参考目标条件强化学习在四足爬箱任务上以约少 65% 迭代达到 95% 成功率
相关研究与后续进展核心概要
作者提出 BVER——一种受双向 RRT 规划启发的双向课程方法,同时从目标向外扩展起始状态、从初始状态分布向外扩展目标,并用 Voronoi 偏置把两端引向未探索任务空间并相互靠拢,在点质量迷宫、四足爬箱和机械臂套环任务上比所有对比的无参考课程学习更快,在 0.4 米箱体上以约少 65% 的迭代达到 95% 成功率,是其中唯一学会爬 0.7 米箱体的方法,并在无演示条件下接近基于参考课程在 0.4 米箱体和套环任务上的样本效率。
Figure 2: BVER’s expansion mechanism. Intermediate starts s i s_{i} (blue) grow from the target goal g ⋆ g^{\star} and goals g i g_{i} (green) from the initial distribution ρ 0 \rho_{0} . Random walks start from the states nearest to uniform task-space samples, favoring states whose Voronoi cell (shaded) reaches into unexplored space, or nearest to the other direction’s solved states to connect the two (dashed).
arXiv深度剖析
BVER 同时从两端扩展课程:从目标向外生长起始状态,从初始状态分布向外生长目标,并对两端施加 Voronoi 偏置以指向未探索任务空间,同时让两端相互靠拢,最终在两端数据上训练同一个目标条件策略。 此前的自动起始状态与目标课程通常只从一侧扩展,因而必须由该侧覆盖到目标的全部距离;BVER 借鉴双向 RRT 规划,把双向扩展引入无参考课程学习。 摘要给出方法构成与动机,并以消融结果支持:从两端扩展优于任一单向扩展。
在点质量迷宫、四足爬箱和机械臂套环三类任务上,BVER 比所有被比较的无参考课程学习更快。 相对无参考课程基线,BVER 在多个任务族上取得更快的学习速度,而非仅在单一环境上有效。 摘要报告三类任务上的对比结果,未给出各基线的具体数值。
在四足爬箱任务上,BVER 在 0.4 米箱体上以约少 65% 的迭代达到 95% 成功率,是所比较方法中唯一学会爬 0.7 米箱体的,并得到对起始状态、目标和偏航变化稳健的策略。 相比最优的无参考课程基线,BVER 在迭代效率与可达箱体高度上同时取得优势,并额外获得对起始、目标与偏航扰动的稳健性。 摘要给出 95% 成功率、约 65% 迭代缩减、0.7 米箱体唯一成功与稳健性描述,均为摘要层面的报告值。
在没有演示的条件下,BVER 在 0.4 米箱体和套环转移任务上接近基于参考课程的样本效率。 说明双向自动课程可以在不依赖参考运动或演示的情况下缩小与参考类方法的样本效率差距。 摘要以“接近”描述该对比,未给出具体样本量或曲线数值。
启示与展望
该工作面向无参考、稀疏奖励、长时程的目标条件强化学习设定,适用于希望避免演示采集与任务专用奖励工程的研究者与工程团队;其验证场景为点质量迷宫、四足爬箱与机械臂套环转移,其中爬箱任务的具体指标为 0.4 米箱体 95% 成功率、约少 65% 迭代,以及 0.7 米箱体的唯一成功。方法层面,Voronoi 偏置与双向扩展的组合为把规划中的双向思想移植到课程生成提供了可复用的思路。
摘要未给出各基线的具体数值、迭代次数绝对值、随机种子数量与统计波动,也未说明 Voronoi 偏置的具体实现、超参数敏感性以及在真实机器人上的表现;0.7 米箱体“唯一成功”的判定范围限于所比较的无参考课程。上述内容需查阅正文与图表才能确认,因此本总结仅基于摘要层面的信息。
