跳到主要内容
返回时间线
arXiv来源发表:

FERPO 提出不依赖 critic 动作梯度的最大熵策略优化,在 MuJoCo Playground 与 ManiSkill 上取得有竞争力的表现与样本效率提升

相关研究与后续进展

核心概要

FERPO 是一种在线最大熵强化学习算法,它从经熵与 KL 正则化的策略改进目标导出最优目标动作分布,再用自归一化重要性采样(SNIS)估计的前向 KL 目标把 actor 拟合到该分布,从而在不求 critic 对动作的导数的情况下完成策略改进;在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示其表现有竞争力、样本效率提升,计算基准显示 actor 更新快于 REPPO。

Source-provided article image: FERPO: Forward Entropy-Regularized Policy Optimization
Figure 1 ·

Figure 1: Actor directions and local losses. Top: green/red arrows point toward/away from the cost minimum (star); lengths are illustrative, not convergence guarantees. Bottom: frozen-reference losses at A–C, zeroed at the reference; KL losses are scaled by T T . Details: Appendix A.1 .

arXiv

深度剖析

FERPO 用 critic 的值而非 critic 对动作的梯度来做策略改进,避开了“值预测准确未必意味着动作导数准确”这一环节。 已有连续控制在线强化学习的先进方法多依赖学习到的 critic 的动作梯度来改进策略,而 FERPO 明确把动作导数从策略改进路径中移除。 摘要以论证方式陈述该设计动机,并说明 FERPO 是在线最大熵算法;具体实现细节与消融设置需查阅正文。

FERPO 从带熵与 KL 正则化的策略改进目标推导出最优目标动作分布,并用前向 KL 目标拟合 actor。 与可能偏向目标分布部分模态的反向 KL 目标不同,前向 KL 目标鼓励覆盖多个高价值模态,从而促进探索。 摘要给出目标分布的推导来源与前向 KL 拟合方式,并说明 KL 正则化通过限制目标分布偏离 rollout 策略来保持重要性权重表现良好。

前向 KL 目标用自归一化重要性采样(SNIS)估计,动作取自 rollout 策略。 把 SNIS 与前向 KL 结合,使 actor 拟合可以在 rollout 策略采样的动作上进行,而 KL 正则化控制目标分布与 rollout 策略的偏离。 摘要明确说明估计方法为 SNIS、采样来源为 rollout 策略,并解释 KL 正则化对重要性权重的作用。

在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示有竞争力的表现与样本效率提升,计算基准显示 actor 更新快于 REPPO。 摘要同时报告了任务性能、样本效率与 actor 更新速度三类结果,其中与 REPPO 的比较属于计算基准。 摘要陈述了实验平台与消融、样本效率提升以及相对 REPPO 的更新速度优势;具体数值、任务数量与统计细节未在摘要中给出。

启示与展望

该工作面向连续控制中的在线最大熵强化学习,适用于使用 rollout 策略采样动作、并以 critic 值进行策略改进的设置;摘要所述验证覆盖 MuJoCo Playground 与 ManiSkill,并包含消融与相对 REPPO 的计算基准。对希望避免对 critic 求动作导数、或关注 actor 更新计算开销的研究者与工程实践者,FERPO 提供了一条可复现的算法路线:从正则化策略改进目标导出目标动作分布,再用 SNIS 估计的前向 KL 拟合 actor。

摘要未给出各任务的具体性能数值、样本效率提升幅度、消融的具体配置以及计算基准的测量条件,因此难以判断优势在不同任务与超参数下的稳健程度。前向 KL 与 SNIS 的重要性权重表现依赖 KL 正则化对目标分布偏离 rollout 策略的限制,这一限制在不同设置下的合适程度仍是开放问题。此外,摘要未说明与 REPPO 之外方法的比较范围,也未说明 MuJoCo Playground 与 ManiSkill 之外任务的迁移表现。

来源