arXiv 该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。
该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。
该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。
该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。