跳到主要内容
返回时间线
arXiv来源发表:

POPO 仅在正样本 rollout 上做在线自蒸馏,在 AIME 2025 上以 Qwen-Math-7B 取得 36.67%,高于 GRPO 的 30.00%

核心概要

该工作提出 Positive-Only Policy Optimization(POPO),一种只在线正样本 rollout 上学习的 on-policy 自蒸馏与 RLVR 结合框架,用有界重要性采样、带动量自适应律的孪生策略网络和有界相似度惩罚替代 KL 散度,在 MATH-500、AMC23、AIME 2024/2025 和 Olympiad 等数学基准上优于 GRPO,其中 Qwen-Math-7B 在 AIME 2025 上达到 36.67%,GRPO 为 30.00%。

Source-provided article image: Improving Reasoning Ability via Asynchronous On-Policy Self-Distillation under Positive Rollouts
Figure 1 ·

Figure 1: (A) Scheme of RLVR for mathematical question-solving tasks. A general on-policy RL algorithm will reinforce the positive rollouts, while penalizing the negative rollouts. However, the negative rollouts may not contain a meaningful reasoning chain-of-thought in addressing the graduate-level mathematical questions, which motivates the POPO algorithm design. (B) A comparison of POPO and GRPO on the reward trace (upper panel) and mean output completion length (lower panel) on a simple GSM8K dataset.

arXiv

深度剖析

提出 POPO,一个只在在线正样本 rollout 上学习的 on-policy 自蒸馏与 RLVR 集成框架,训练中不使用互不相交的负样本 rollout 提供梯度指导。 相对依赖正负样本共同给出奖励信号的 RLVR 做法,该工作把学习信号完全限定在正样本集合上,并指出负样本 rollout 可能没有失败程度的层次,且在稀疏二值奖励下惩罚少量采样负样本难以覆盖有意义的奖励信号。 摘要给出方法层面的说明:对正样本 rollout 集合使用有界重要性采样,并称通过 rollout 重分配强化正概率可自然产生隐式负梯度;具体推导细节未在给定文本中展开。

通过自蒸馏稳定策略优化:采用带基于动量的自适应律的孪生策略网络实现异步策略演化,并用孪生表示空间中的有界相似度惩罚项替代 KL 散度。 把稳定化机制从常见的 KL 散度约束改为表示空间中的有界相似度惩罚,并引入动量自适应律支持异步策略演化。 摘要明确列出这两项设计,并称消融与扫描研究说明其必要性与鲁棒性;具体消融设置与数值未在给定文本中给出。

在公开且成熟的文本 LLM 上跨各级数学基准(MATH-500、AMC23、AIME 2024/2025、Olympiad)实验,POPO 表现优于 GRPO,其中 Qwen-Math-7B 在 AIME 2025 上达到 36.67%,GRPO 为 30.00%。 给出了与 GRPO 的直接对比结果,并在 AIME 2025 上报告了具体分数差。 摘要报告了基准名称、对比方法与一个具体数值对比;完整实验表格、重复次数与统计细节未在给定文本中呈现。

启示与展望

该工作面向使用可验证奖励的文本 LLM 后训练,尤其是数学推理场景,实验覆盖 MATH-500、AMC23、AIME 2024/2025 与 Olympiad 等公开基准,并以 Qwen-Math-7B 等公开模型与 GRPO 对比。它适合希望减少对负样本 rollout 依赖、或想用自蒸馏稳定策略优化的研究者与工程实践者参考。适用前提是存在可判定的正样本 rollout 与二值奖励信号;在奖励不可验证或正样本极稀缺的设定下是否同样有效,文本未作说明。

给定文本为摘要,未包含完整实验表格、消融与扫描的具体设置和数值、训练成本、重复次数与方差信息,因此无法判断 36.67% 与 30.00% 差距的稳定性。隐式负梯度如何由 rollout 重分配产生,其推导与适用条件仍需查看正文。有界相似度惩罚项的形式、边界取值与动量自适应律的超参数敏感性,也属于需要进一步阅读确认的开放问题。此外,正样本-only 学习在正样本稀少或奖励噪声较大的任务上表现如何,文本未涉及。

来源