跳到主要内容
返回时间线
arXiv来源发表:

TRM 先为每个案例生成自适应评分细则再打分,在图像生成与编辑奖励建模基准上超过开源模型并逼近专有模型

核心概要

该工作提出“Think Before You Score”范式与 Thinking Reward Model(TRM):先针对每个任务条件与候选输出生成案例自适应评分细则,再逐条判定并汇总为细粒度逐点奖励,同时提出 PD-GRPO 用成对偏好监督提升区分度并抑制分数极化;在图像生成与编辑奖励建模基准上,TRM 在开源奖励模型中达到最优并与专有模型高度接近,作为强化学习奖励信号还能持续提升多种视觉生成模型。

AI-generated editorial illustration: Think Before You Score: Thinking Reward Model for Visual Generation

深度剖析

TRM 把视觉奖励建模从“条件与候选直接映射为标量分数”改为“先确定本案例该评什么、再判断做得如何”,用案例自适应细则、细则级判定、维度级汇总和最终逐点分数构成确定—检查—汇总—打分的流程。 既有视觉奖励模型多依赖固定评价标准,即使引入推理也较少显式回答“这个具体案例该评什么”;TRM 让细则由任务条件与候选输出即时实例化,而高层维度(生成与编辑共享 Prompt Alignment 与 Visual Quality,生成另有 Aesthetics、编辑另有 Source Consistency)保持统一结构。 论文以表格对比说明既有方法普遍缺少自适应细则,并给出 TRM 的流程定义与三维度实例化;属于范式与结构层面的论证,配合后续基准结果支撑。

作者构建了约 20K 图像生成案例与 28K 图像编辑案例(合计约 48K)的训练数据,通过统一流水线与两阶段“人在环中”标注产出结构化监督:案例自适应细则、细则级判定与质量分数。 相比只提供标量偏好或分数的数据,这里提供的是可学习的结构化评价轨迹,并覆盖多任务、多难度、多模型来源与多种失败模式,编辑数据还按原评分重新平衡以强调中间质量区间。 数据规模、来源基准(如 Edit-Compass、UniREdit-Bench、Qwen-Image-Bench、EvalMuse 等)与两阶段标注流程在正文与附录中均有描述;具体标注一致性指标未在文本中给出。

针对 Bradley–Terry 式成对目标在偏好顺序已正确后仍持续拉大分差、导致分数极化的问题,作者提出 PD-GRPO:对同一偏好对的两个候选各自独立采样逐点评价,以对方组均值为参照,只要达到所需间隔边际即不再奖励继续扩大分差。 BT 式目标在分数空间没有内部最优,会把两侧推向边界;PD-GRPO 的奖励在满足边际后变为常数,从而在保留逐点推理接口的同时利用成对监督提升细粒度区分,边际还可按偏好对难度调整。 论文给出 BT 单调性与极化现象的推导与图示,并说明 PD-GRPO 的奖励构造与组相对优势计算;编辑边际设为 0.5、生成边际设为 1.0,均在归一化分数尺度上。

实验显示 TRM 在图像生成与编辑奖励建模基准上达到开源模型最优并与专有模型高度接近,且作为 FlowGRPO 的奖励信号能一致提升 BAGEL、FLUX.1-dev、SD3.5-M 以及 Flux2-Klein 4B/9B、Flux-Kontext、SenseNova-U1.5 等生成与编辑模型。 生成侧 TRM(RL) 在 GenAI-T2I/MMRB2-T2I 上为 71.2%/67.9%,高于 SFT 的 70.1%/65.8% 与基线 58.9%/59.4%;编辑侧 TRM(RL) 在 EditScore-ERB 为 0.786/0.674/0.773、MMRB2 58.2%、EditReward-ERB 71.3%、EditReward-Compass 0.640/0.660,9B 规模超过 72B 的 EditScore;下游 RL 中 BAGEL 在 TIIF-Long 提升 5.81 分,FLUX.1-dev 在 TIIF-Short/Long 分别提升 6.76 与 6.56 分。 结果覆盖多个公开基准与多类基线(GPT、Gemini、Qwen 系列及 HPSv3、UnifiedReward、RationalRewards、EditScore、FIRM-Reward 等),并配有消融(与 AlphaGRPO 同骨干对比、与 EditScore-72B 同训练设置对比)与定性图例;生成侧主表采用非并列预测上的准确率,并列感知结果在附录给出。

启示与展望

该工作面向图像生成与图像编辑两类视觉生成任务的奖励建模与 RL 后训练:生成侧条件为文本提示,编辑侧条件为源图加编辑指令,评价结构统一为 Prompt Alignment 与 Visual Quality 加各自任务特定维度。它适用于需要细粒度、可解释逐点奖励来驱动 FlowGRPO 类在线优化的场景,也适用于希望以较小奖励模型替代大规模专用奖励模型的团队;论文同时给出异步奖励计算与共享前缀缓存等部署手段,说明其目标设定包含实际 RL 训练中的推理开销。

文本为完整论文的解析结果,但部分数值在正文中以占位形式出现(如学习率、KL 系数、部分边际与批量设置的具体取值),因此这些超参的精确值仍需查阅原文附录确认。此外,主表生成侧准确率排除了并列预测,并列感知结果在附录给出,两种口径下的结论一致性值得读者对照;标注流程中专家校准的一致性程度、以及案例自适应细则在训练分布之外任务上的表现,文本未给出量化结论,属于可继续观察的开放问题。

来源