arXiv 2026年10月1日该工作识别出基于概率奖励的无验证器强化学习中的长度依赖失效模式——后验集中现象(PCP),即参考答案在推理轨迹变长时其条件概率坍缩到低方差区间、奖励几乎不可区分,并据此提出 RLCPR 框架,用不确定性感知数据采样与集中感知正则化两项组件改善优化稳定性与 token 效率,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%。该工作识别出基于概率奖励的无验证器强化学习中的长度依赖失效模式——后验集中现象(PCP),即参考答案在推理轨迹变长时其条件概率坍缩到低方差区间、奖励几乎不可区分,并据此提出 RLCPR 框架,用不确定性感知数据采样与集中感知正则化两项组件改善优化稳定性与 token 效率,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%。RLCPR 通过刻画后验集中现象,在七个基准中的六个上比无验证器强化学习基线最高提升 4.0%该工作识别出基于概率奖励的无验证器强化学习中的长度依赖失效模式——后验集中现象(PCP),即参考答案在推理轨迹变长时其条件概率坍缩到低方差区间、奖励几乎不可区分,并据此提出 RLCPR 框架,用不确定性感知数据采样与集中感知正则化两项组件改善优化稳定性与 token 效率,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%。该工作识别出基于概率奖励的无验证器强化学习中的长度依赖失效模式——后验集中现象(PCP),即参考答案在推理轨迹变长时其条件概率坍缩到低方差区间、奖励几乎不可区分,并据此提出 RLCPR 框架,用不确定性感知数据采样与集中感知正则化两项组件改善优化稳定性与 token 效率,在七个基准中的六个上比最先进的无验证器强化学习基线最高提升 4.0%。