EasyPPO 指出 PPO 评论家两类失效模式,在三项任务上稳定训练并相对 PPO 提升 14.89%、2.28%、9.47%
核心概要
该工作识别出 PPO 在 LLM 强化学习中的两类评论家失效模式——对截断轨迹同时过滤演员与评论家会把策略目标变为“以完成为条件”的奖励,以及同一批次内不同提示的回报噪声异质会让高方差提示主导评论家更新——并提出 EasyPPO,用仅作用于演员的超长过滤、按回报标准差倒数加权的噪声归一化评论家回归、以及配合梯度裁剪的适度更小评论家小批量来应对,在 FrontierCS 连续奖励编程、AIME24 二元奖励数学推理和 Search-R1 多轮搜索上全程保持稳定,最佳验证分数相对 PPO 分别提升 14.89%、2.28% 和 9.47%。
深度剖析
论文指出,把超长过滤从演员扩展到评论家会改变评论家学到的目标:它从预测全部 rollout 的平均回报,变成只预测已完成回答的平均回报,在准确评论家极限下把策略目标变成“以完成为条件”的奖励,于是截断比例上升的同时条件奖励仍可能改善。 此前超长过滤主要用于 GRPO 等无评论家方法以减少截断带来的奖励噪声,Nemotron-Cascade 等也在数学 RL 中排除超长 rollout;该工作把这一做法放进 PPO 的演员—评论家框架中分析,指出同时过滤两侧会改变策略目标本身。 论文给出理想化极限下的推导,并在 FrontierCS 上比较三种过滤策略:不过滤时 PPO 反复出现奖励崩塌;同时过滤演员与评论家时非截断 rollout 的奖励上升但截断比例趋近上限、整体奖励仍低;仅过滤演员最稳定且整体分数最高。AIME 设置中同时过滤也出现截断上升与整体奖励下降。
论文指出第二类失效来自批次内回报噪声的异质性:评论家最小化均方误差时,回报噪声不改变最优预测,却与预测误差一起进入期望梯度平方幅值,随着预测变准,噪声可能占主导,使回报方差大的提示在有限批次中不成比例地影响更新。 方差加权回归在 RL 与监督学习中已有研究,但该工作利用 LLM RL 中同一提示的成组采样直接估计提示级回报方差,无需额外的方差模型,并把这种加权用在评论家损失而非演员优势上。 论文给出梯度二阶矩分解,并提出按提示回报标准差倒数加权、权重在提示批次上归一化到均值一,对离散奖励给出方差下限。在 FrontierCS 与 AIME 的离线诊断中,未归一化时回报方差更大的提示倾向于贡献更大梯度且在后段检查点更明显,归一化后这种依赖大幅减弱;作者同时说明仍存在梯度离群点,AIME 的趋势不如 FrontierCS 一致。
论文提出 EasyPPO 的三项改动——仅对演员做超长过滤、噪声归一化评论家回归、以及配合梯度裁剪的适度更小评论家小批量——并报告其在三类任务上全程稳定且优于基线。 与 VAPO 的价值学习与优势估计改进、HL-Gauss PPO 的分类式评论家目标不同,EasyPPO 保留标准 PPO 演员更新,针对的是评论家对提示级回报噪声的暴露与过滤策略对目标的影响。 在 FrontierCS、AIME24、Search-R1 上训练 200–300 次更新,EasyPPO 是唯一在三项任务上均稳定的对比方法,最佳验证分数相对 PPO 分别提升 14.89%、2.28%、9.47%;FrontierCS 上三次随机种子运行均未崩塌,而仅过滤演员的基线三次中有两次崩塌。消融显示噪声归一化在两种小批量配置下都稳定训练,而缺少归一化时把同一 rollout 批次拆成四个更小小批量会出现持续崩塌。
论文给出评论家小批量大小的权衡:更小的小批量把离群点经裁剪后的影响限制在更少的 rollout 上,但每次裁剪操作面对的随机波动更大,因此选择中等规模。 这一分析把裁剪粒度与噪声平均作为一对相互竞争的因素来处理,而不是单纯追求更大的评论家批量。 论文在固定参数理想化模型下给出单个离群点影响的界与每小批量梯度方差的关系,并在 FrontierCS 上变化每 rollout 批次的评论家小批量数:首次跨越某解释方差的步数随小批量数近似线性下降,而更大的小批量在训练后段取得更高解释方差。
启示与展望
该结果面向使用 PPO 类演员—评论家方法做 LLM 强化学习后训练的研究与工程场景,尤其是奖励连续、同一提示回报方差差异大的任务;论文的实验覆盖 FrontierCS 连续奖励编程、AIME24 二元奖励数学推理与 Search-R1 多轮搜索,模型为 Qwen3.5-9B 与 Qwen3.5-9B-Base,训练时长为 200–300 次更新。对读者而言,可直接借鉴的是三条可操作准则:超长过滤只作用于演员、按提示回报标准差倒数加权评论家回归、以及选择中等规模的评论家小批量并相应调整学习率。论文还指出,当希望减少每个提示的 rollout 数量时,可用离线画像配合在线更新来估计方差,这被留作后续工作。
离线梯度诊断刻画的是终端回报均方误差的梯度,不重放训练时的 GAE 目标与优化器更新,作者也说明拟合只反映关联而非因果;AIME 的二元奖励使经验回报标准差只能取离散值,重加权并未在每个检查点都压平趋势,最大贡献项也未一致减小。噪声归一化使用与训练评论家相同的 rollout 组估计权重,作者指出这可能引入偏差但在实践中表现良好。小批量分析基于固定参数与独立 rollout 的假设,顺序 Adam 步会重算梯度并更新优化器状态,因此该界不约束最终参数变化。此外,重复种子研究只在 FrontierCS 上对 EasyPPO 与仅过滤演员的基线各做三次,其他任务为每种方法一次运行;本证据包为全文,但图表以引用形式出现,具体数值需回到原文表格核对。
