用狄利克雷过程混合技能先验做长时程机器人操作,在1.5M步内成功率超0.8,而SAC在5M步后仍低于0.1
核心概要
该工作提出一种基于狄利克雷过程混合的贝叶斯非参数技能先验,在结构化潜空间中建模时序延展技能,无需预设组件数量即可自适应发现技能,并将其嵌入分层强化学习框架,由学习到的先验指导高层技能选择、由预训练解码器生成时序抽象动作;在Franka Kitchen、LIBERO-Long、Meta-World和一台真实机器人上,长时程操作取得一致提升,1.5M步内成功率超过0.8,而SAC即使训练5M步也未收敛(低于0.1),相对单高斯先验基线平均提升21.8%。
Fig. 1: HELIOS Framework overview. The training process is divided into two phases. In Phase I, a VAE with GRU modules is used to pre-train a skill representation model from a dataset of action trajectories. The model leverages a DPM to capture the non-parametric nature of skill priors, aiding in learning precise action patterns and subsequent effective task representations. In Phase II, this pre-trained skill decoder and prior are deployed within a RL framework to address long-horizon manipulation tasks. Here, the upstream inference model uses soft actor-critic structure to learn specific task reasoning, ensuring the successful execution of complex, extended long-horizon tasks.
arXiv深度剖析
提出用狄利克雷过程混合构建贝叶斯非参数技能先验,在结构化潜空间中表示时序延展技能,使技能组件数量无需预先设定即可自适应确定。 既有技能方法通常假设固定参数化先验(例如单一高斯),难以刻画复杂任务所需的多模态技能结构;该工作以非参数混合替代固定先验,把技能发现从预设组件数中解放出来。 摘要说明该先验被集成进分层强化学习框架,学习到的先验指导高层技能选择,预训练解码器生成时序抽象动作;在稀疏奖励设定下改善探索效率。
在稀疏奖励的长时程操作任务上,该方法在Franka Kitchen、LIBERO-Long、Meta-World及一台真实机器人上取得一致提升,1.5M步内成功率超过0.8。 作为对照,SAC即使训练5M步也未收敛,成功率低于0.1,说明该方法在延迟反馈与探索低效的设定下具备明显优势。 摘要给出跨四个评测环境(含真实机器人)的一致增益,并给出成功率与训练步数的具体数值对比。
相对单高斯先验基线,该模型平均提升21.8%。 这一对比直接针对固定参数化先验的局限,量化了非参数多模态技能先验相对单高斯先验的收益。 摘要报告平均提升21.8%,为跨任务的平均值,未在摘要中给出逐任务分解。
启示与展望
该结果面向稀疏奖励下的长时程机器人操作,适用于采用分层强化学习、并具备可预训练解码器的设定;受益者是需要多模态技能结构建模的研究者与工程团队。摘要所述证据覆盖Franka Kitchen、LIBERO-Long、Meta-World与一台真实机器人,说明方法在仿真基准与真实平台上均被考察,但摘要未说明真实机器人任务的具体形态与规模。
摘要未给出各任务上的逐项成功率、真实机器人实验的任务设置与试次规模,也未说明狄利克雷过程混合在训练中如何随任务自适应调整组件数;21.8%为跨任务平均值,其分布与方差未知。此外,摘要未报告与更多技能先验方法的对比,因此非参数先验相对其他多模态先验的相对优势仍是开放问题。
