arXiv 2026年10月2日FERPO 是一种在线最大熵强化学习算法,它从经熵与 KL 正则化的策略改进目标导出最优目标动作分布,再用自归一化重要性采样(SNIS)估计的前向 KL 目标把 actor 拟合到该分布,从而在不求 critic 对动作的导数的情况下完成策略改进;在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示其表现有竞争力、样本效率提升,计算基准显示 actor 更新快于 REPPO。FERPO 是一种在线最大熵强化学习算法,它从经熵与 KL 正则化的策略改进目标导出最优目标动作分布,再用自归一化重要性采样(SNIS)估计的前向 KL 目标把 actor 拟合到该分布,从而在不求 critic 对动作的导数的情况下完成策略改进;在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示其表现有竞争力、样本效率提升,计算基准显示 actor 更新快于 REPPO。FERPO 提出不依赖 critic 动作梯度的最大熵策略优化,在 MuJoCo Playground 与 ManiSkill 上取得有竞争力的表现与样本效率提升FERPO 是一种在线最大熵强化学习算法,它从经熵与 KL 正则化的策略改进目标导出最优目标动作分布,再用自归一化重要性采样(SNIS)估计的前向 KL 目标把 actor 拟合到该分布,从而在不求 critic 对动作的导数的情况下完成策略改进;在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示其表现有竞争力、样本效率提升,计算基准显示 actor 更新快于 REPPO。FERPO 是一种在线最大熵强化学习算法,它从经熵与 KL 正则化的策略改进目标导出最优目标动作分布,再用自归一化重要性采样(SNIS)估计的前向 KL 目标把 actor 拟合到该分布,从而在不求 critic 对动作的导数的情况下完成策略改进;在 MuJoCo Playground 与 ManiSkill 上的实验与消融显示其表现有竞争力、样本效率提升,计算基准显示 actor 更新快于 REPPO。