RRT用项目反应理论把评分表判定转成质量奖励,在Qwen3.5-4B上比GRPO高1.7分并省下约一半评判请求
核心概要
该工作提出Rubric Response Theory(RRT),把评分表准则的通过/不通过判定视为对同一潜在质量的项目反应证据,用两参数项目反应模型推断每条 rollout 的质量作为GRPO奖励,并用Response Parameter Network从提示与准则文本预测准则难度与区分度、以在线EM随策略更新,在Medical、Science、Rubrics as Rewards Science与RubricBench四个数据集上以Qwen3.5-4B为策略时宏观准则得分比GRPO高1.7分,在Medical与Science的Hard与Very hard准则上高2.8至5.6分,且在准则预算减半时自适应Fis
深度剖析
RRT把评分表聚合从“满足准则的分数求和”改为对潜在质量的贝叶斯推断,用后验众数作为GRPO奖励,因此总分相同但判定模式不同的 rollout 可以获得不同奖励。 既有做法(如Gunjal等、Arora等)对满足准则的指定分值做加权平均,固定分值只编码准则应占多少权重,不反映该判定在当前 rollout 中区分质量的能力;RRT改为用难度与区分度参数解释整条判定向量。 论文给出定理2:在项目反应模型下,评分表似然得分在所有判定标量函数中最大化对质量变化的局部信噪比并达到Fisher信息界;Proposition 1说明分值相同而判定不同的 rollout 在RRT下仍可被分开。实验上RRT在12个数据集与策略组合中组内方差份额为分值奖励的1.2至2.2倍,并列对比例减少2%至58%。
Response Parameter Network从提示与准则文本预测准则难度与区分度,并用在线EM随策略分布变化更新,使参数估计不依赖固定的经验通过率。 此前IRT相关工作多用于固定被试或模型的校准、评估与数据筛选;RRT把该测量用于策略训练,让每条 rollout 的测得质量成为奖励,并让文本预测支持未见过的评分表。 在线RPN在下一策略步的宏观Pearson相关上比冻结RPN高1.7分(Medical +2.7、Science +0.7);预测难度与经验难度的Spearman相关为38.0%至47.9%;硬E步比测试的软E步ROC-AUC高0.6至1.3分、准则损失低0.011至0.017。
同一套Fisher信息既用于奖励推断也用于准则选择,在准则预算下减少评判请求。 自适应测试长期用信息量选题,但此前未与策略训练中的评分表准则选择结合;RRT按当前推断质量对未评判准则排序,并在每评判一条后更新质量。 在训练后策略的 rollout 上,自适应Fisher选择在平均Pearson相关达到95.0%时留下21.0%的准则未评判,比随机选择多11.0个百分点;准则预算0.50时RRT宏观准则得分与全量评判的GRPO相差不超过0.1分,Medical与Science的评判请求减少49.0%,中位评判时间减少49.1%至49.6%,总步时减少23.5%至28.7%。
在Qwen3.5-4B主比较中,RRT+在线RPN在准则得分与归一化分值两项宏观指标上均最高或并列最高,并在难准则上收益更大。 相对Vanilla GRPO、POW3R与DIVA这些同样使用当前 rollout 的聚合方法,RRT替换了加权求和形式,并同时给出准则选择能力。 RRT+在线RPN比Vanilla GRPO高1.7分、比POW3R高0.8分;在Medical与Science的八个难度带中有七个超过Vanilla GRPO,包括全部Medium、Hard与Very hard带,增益2.8至5.6分;在HealthBench与ResearchQA上比Vanilla GRPO高0.1至0.7分;12个数据集与策略组合中RRT的中位响应长度均更低。
启示与展望
该结果面向准则为同一潜在质量单调指标的评分表,用于以GRPO类算法训练语言模型策略时的奖励计算与准则选择;作者指出RRT补充而非替代评分表生成,并说明可把该测量扩展到多质量目标以处理带显式权衡的评分表。对使用者而言,这意味着在评判成本是主要瓶颈、且评分表准则共享一个质量目标时,可以用文本预测的难度与区分度参数替代固定分值,并在准则预算下选择信息量最大的准则;训练后策略在部署时不增加参数或推理组件。
准则是否真的只测量一个共享质量仍是开放问题:作者在社区讨论中主动询问准则并非衡量同一质量时的情形,诊断显示拟合质量解释了72.8%至85.3%的成对互信息,而文本最相似的准则对冗余比例高于自助法零假设3.4至11.9个百分点。主比较中每个条件只有一次训练运行,报告的区间刻画的是提示组间变异而非训练随机性。在Qwen3.5-2B与Llama-3.1-8B-Instruct上RRT与Vanilla GRPO的宏观准则得分接近(分别低0.2分与高0.1分),因此增益的稳健性仍需更多策略与运行来确认。此外,噪声结构分析显示当噪声与响应长度相关或在所有准则上对称时,准则分值反而领先0.8至1.2分,说明RRT的优势依赖评判误差集中在部分准则这一条件。
