跳到主要内容
返回时间线
arXiv来源发表:

Range-GRPO 用共形校准奖励区间做成对比较,在评测的半监督方法中取得最高分布内与分布外平均性能且训练资源更少

核心概要

该工作提出 Range-GRPO 半监督后训练框架,将 LLM-as-a-Judge 的伪奖励表示为共形校准的奖励区间,并在 GRPO 中对奖励区间做成对比较而非压缩为点奖励,使区间不确定性同时影响学习信号的幅度与方向;理论分析表明当所有奖励区间退化为点时该目标可恢复 GRPO 优势,实验显示其在所评测的半监督方法中取得最高的分布内与分布外平均性能,且所需训练资源更少。

Source-provided article image: Range-GRPO: Policy Optimization via Pairwise Relations among Reward Intervals
Figure 1 ·

Figure 1: Overview of Range-GRPO and its learning signals. (a) At initialization, Range-GRPO fits a state scorer on labeled source rollouts and computes nonconformity scores on calibration rollouts. Each iteration generates policy and target DRE rollouts with G G and G ′ G^{\prime} responses, respectively, and updates density ratios using the target states and reused source states. The density ratios, fixed scorer, and calibration scores are used to construct reward ranges, from which pairwise interval comparisons construct the advantages for policy updates. (b) An illustrative comparison uses identical reward intervals for both methods. Although the interval for o 2 o_{2} lies above that for o 3 o_{3} with the same width, midpoint reduction assigns it a negative advantage under Dr.GRPO. Range-GRPO instead downweights pairwise contributions involving wider, more uncertain intervals, turning this advantage positive and aligning the direction of the learning signal with the oracle preference.

arXiv

深度剖析

提出 Range-GRPO,把伪奖励表示为共形校准的奖励区间,并在 GRPO 内对奖励区间进行成对比较,而不是先归约为点奖励。 相对于以单一分数作为伪奖励的 LLM-as-a-Judge 做法,该目标让区间不确定性同时作用于学习信号的幅度与方向。 摘要给出方法层面的描述与理论分析,说明该目标在奖励区间全部退化为点时恢复 GRPO 优势;具体实验设置与数值未在摘要中给出。

构建半监督后训练框架,将有限标注数据与无标注提示结合使用。 针对缺少参考答案或可执行验证器的领域,把可扩展的伪奖励与少量可靠监督结合,而不是只依赖其中一种。 摘要说明该框架结合有限标注数据与无标注提示,并称其在所评测的半监督方法中表现最好;未提供数据规模或标注比例。

在所评测的半监督方法中,Range-GRPO 取得最高的分布内与分布外平均性能,同时所需训练资源更少。 把区间不确定性纳入 GRPO 的相对比较后,在分布内与分布外两类评测上都报告了领先的平均表现,并伴随更低的训练资源需求。 摘要报告了该比较结论,但未列出基线清单、评测任务、指标数值或资源度量方式。

启示与展望

该工作面向缺少参考答案或可执行验证器、因而依赖 LLM-as-a-Judge 伪奖励的后训练场景,适用于能够获得少量标注数据并拥有大量无标注提示的半监督设定。其目标设计使奖励区间的不确定性进入 GRPO 的相对比较,因此对希望在不增加标注成本的前提下利用无标注提示的研究者与工程实践者具有直接参考价值;理论分析给出的适用条件是所有奖励区间退化为点时恢复 GRPO 优势。

摘要未列出所比较的半监督方法、评测任务与指标数值,也未说明训练资源的具体度量方式,因此性能领先的幅度与资源节省程度仍需在正文中确认。共形校准的具体构造、区间宽度如何影响优化稳定性,以及理论分析所依赖的假设,都是读者在阅读全文时需要留意的开放问题。

来源