arXiv 2026年10月5日该工作提出 Tropical Reinforcement Learning 与训练算法 TROPIC,把大语言模型强化学习中累加成功轨迹概率的期望回报改为在热带半环下取最大值,使状态价值成为其最可能被验证解的对数概率并附带可重放复用的显式路径,从而允许把来自不同 rollout 的最佳前缀与最佳后缀在共享状态处拼接;在 Sokoban、Countdown、FrozenLake、WebShop 四个智能体任务上,TROPIC 比最强的同策略基线高出最多 16 个百分点。该工作提出 Tropical Reinforcement Learning 与训练算法 TROPIC,把大语言模型强化学习中累加成功轨迹概率的期望回报改为在热带半环下取最大值,使状态价值成为其最可能被验证解的对数概率并附带可重放复用的显式路径,从而允许把来自不同 rollout 的最佳前缀与最佳后缀在共享状态处拼接;在 Sokoban、Countdown、FrozenLake、WebShop 四个智能体任务上,TROPIC 比最强的同策略基线高出最多 16 个百分点。TROPIC 把强化学习的求和换成取最大值,在四个智能体任务上比最强同策略基线高出最多 16 个百分点该工作提出 Tropical Reinforcement Learning 与训练算法 TROPIC,把大语言模型强化学习中累加成功轨迹概率的期望回报改为在热带半环下取最大值,使状态价值成为其最可能被验证解的对数概率并附带可重放复用的显式路径,从而允许把来自不同 rollout 的最佳前缀与最佳后缀在共享状态处拼接;在 Sokoban、Countdown、FrozenLake、WebShop 四个智能体任务上,TROPIC 比最强的同策略基线高出最多 16 个百分点。该工作提出 Tropical Reinforcement Learning 与训练算法 TROPIC,把大语言模型强化学习中累加成功轨迹概率的期望回报改为在热带半环下取最大值,使状态价值成为其最可能被验证解的对数概率并附带可重放复用的显式路径,从而允许把来自不同 rollout 的最佳前缀与最佳后缀在共享状态处拼接;在 Sokoban、Countdown、FrozenLake、WebShop 四个智能体任务上,TROPIC 比最强的同策略基线高出最多 16 个百分点。