跳到主要内容
返回时间线
arXiv来源发表:

RLCPR 通过刻画后验集中现象,在七个基准中的六个上比无验证器强化学习基线最高提升 4.0%

相关研究与后续进展

核心概要

该工作识别出基于概率奖励的无验证器强化学习中的长度依赖失效模式——后验集中现象(PCP),即参考答案在推理轨迹变长时其条件概率坍缩到低方差区间、奖励几乎不可区分,并据此提出 RLCPR 框架,用不确定性感知数据采样与集中感知正则化两项组件改善优化稳定性与 token 效率,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%。

Source-provided article image: Rethinking Probability-Based Reinforcement Learning From Posterior Concentration
Figure 1 ·

Figure 1: RLCPR performance on representative general-domain and mathematical benchmarks.

arXiv

深度剖析

论文识别并命名了概率奖励的长度依赖失效模式——后验集中现象(PCP):随着推理轨迹变长,参考答案在给定推理轨迹下的条件概率常常坍缩到一个低方差区间。 此前无验证器、基于概率奖励的强化学习在长程推理中的奖励可靠性尚未被充分探索,该工作把这一现象明确刻画为与轨迹长度相关的失效模式。 基于对条件概率随轨迹长度变化的观察性分析,摘要以“often collapses to a low-variance interval”描述该现象。

论文指出 PCP 导致奖励几乎不可区分,在 GRPO 类设置下使基于概率的策略优化不稳定且低效。 把奖励层面的坍缩与优化层面的不稳定、低效联系起来,说明该现象不只是度量问题,而会影响训练过程。 摘要给出机制性论断,限定在“GRPO-based settings”下成立。

论文提出 RLCPR,一个显式考虑 PCP 的无验证器强化学习框架,包含不确定性感知数据采样与集中感知正则化两个组件。 不确定性感知数据采样在生成之前减少易发生集中的 rollout;集中感知正则化在后验奖励坍缩时惩罚不必要的长轨迹。 两个组件分别对应生成前与训练中的干预,摘要给出其功能定位。

实验显示 RLCPR 在更高 token 效率的同时,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%,覆盖通用领域与数学推理任务。 相对基线,该框架在多数基准上取得提升并同时改善 token 效率。 摘要报告“up to 4.0%”与“six of seven benchmarks”,并说明基准涵盖通用领域与数学推理挑战。

启示与展望

该工作面向无外部验证器、以概率作为奖励的强化学习场景,尤其是 GRPO 类设置下的长程推理训练;其目标是提升优化稳定性与 token 效率。对使用此类奖励训练的 LLM 推理研究者与工程实践者,RLCPR 提供了两个可直接借鉴的干预点:在生成前降低易集中 rollout 的采样,以及在奖励坍缩时对过长轨迹施加正则化。适用性以摘要所述的通用领域与数学推理基准为范围。

可见文本为摘要级信息,未列出具体基准名称、模型规模、训练配置与统计显著性,因此 4.0% 提升与 token 效率改善的具体条件仍需在正文中核对。PCP 的判定阈值、低方差区间的界定方式,以及两项组件各自的独立贡献,也属于读者会继续关注的问题。该现象在其他奖励形式或非 GRPO 优化器下是否同样出现,是值得进一步观察的方向。

来源