跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

TROPIC 把强化学习的求和换成取最大值,在四个智能体任务上比最强同策略基线高出最多 16 个百分点

该工作提出 Tropical Reinforcement Learning 与训练算法 TROPIC,把大语言模型强化学习中累加成功轨迹概率的期望回报改为在热带半环下取最大值,使状态价值成为其最可能被验证解的对数概率并附带可重放复用的显式路径,从而允许把来自不同 rollout 的最佳前缀与最佳后缀在共享状态处拼接;在 Sokoban、Countdown、FrozenLake、WebShop 四个智能体任务上,TROPIC 比最强的同策略基线高出最多 16 个百分点。