跳到主要内容
返回时间线
arXiv来源发表:

DRM 用扩散头替代标量奖励头:在五个基准上匹配或超越同数据同骨干基线,并让奖励分布随人类分歧变得更双峰

核心概要

该工作提出 DRM(Diffusion Reward Model),把奖励建模改写为对条件奖励分布的密度估计:在冻结的 LLM 编码器之上用一个轻量 Diffusion Transformer 从高斯噪声去噪出奖励向量,不预设任何参数族,同一架构同时支持多属性回归与成对偏好数据,在五个基准上匹配或超越同数据同骨干的标量头 ArmoRM 与分位数头 QRM,并在重复人类标注数据上显示出与人类分歧相关的多峰结构,同时通过不确定性拒绝、LCB 聚合与下游 RLHF 实验展示分布信息的实用价值。

AI-generated editorial illustration: Diffusion Reward Models

深度剖析

论文指出标量、多属性与参数化分布奖励模型共享一个限制:都承诺了固定的输出分布族,而人类偏好本身是多峰的;据此把奖励建模重新表述为对条件奖励分布的密度估计。 相对此前 DPL、URM 预测高斯、DPRM 预测类别分布、QRM 预测固定分位数网格的做法,DRM 不对输出分布形状作参数假设,用迭代去噪隐式表示分布。 该判断建立在论文对既有奖励建模范式的梳理与对多峰偏好文献的引用之上,属于问题设定层面的论证,而非单一实验结论。

DRM 在冻结的 FsfairX-LLaMA3-RM-v0.1 编码器之上,用约 12.0M 参数的 Diffusion Transformer 头替换原标量头,同一架构既可用掩码去噪损失训练多属性回归,也可用分布级 Bradley–Terry 目标训练成对偏好数据。 此前多属性奖励模型需要预定义属性模式并用门控折叠为标量,生成式评判器则把负担转移到长推理;DRM 用单一扩散头覆盖两种监督,并在推理时采样出经验奖励分布,可聚合为标量、方差或分位数。 论文给出架构、训练目标与推理流程的完整描述,并报告 DRM-Multi-8B 与 DRM-Pref-8B 两个变体在相同架构与扩散调度下仅奖励维度与少量优化设置不同。

在五个基准(RewardBench v2、PPE、RMB、RM-Bench、JudgeBench)上,DRM-Multi-8B 平均 66.2,超过同数据同骨干的标量头 ArmoRM(62.3)与参数分位数头 QRM(64.1),其中 RMB 上提升最大(78.0);DRM-Pref-8B 平均 65.8。 在数据与骨干固定的受控比较中,唯一变化是奖励头,因此论文把提升归因于扩散头本身;同时 DRM 在绝对分数上仍与更大的判别式、分布式和生成式奖励模型保持竞争力。 受控比较基于相同 ArmoRM 语料与相同冻结骨干,论文明确说明这是最受控的对比;跨家族比较则涉及不同数据与更大骨干,属于竞争力展示而非受控结论。

在带重复人类标注的 HelpSteer2-Disagreements 与 MultiPref 上,DRM 的采样分布与经验人类评分分布更接近(helpfulness 上 Wasserstein 距离 0.804,低于经验先验 1.030、全局高斯 1.032 与逐点基线 1.032),且随人类分歧增大其输出更常呈多峰(helpfulness 从 37.6% 升至 63.2%)。 此前奖励模型只输出点估计或固定族分布,无法表达同一输入下多个可辩护判断;DRM 展示了输入条件的分布建模与人类分歧结构之间的对应关系。 该结论基于重复标注数据集的分布距离指标与按分歧分组的双峰比例统计,属于分布层面的验证;论文也说明单例定性图示仅为示意。

启示与展望

这项工作面向通用域对齐中的奖励建模,适用于希望在同一架构下同时处理多属性标注与成对偏好、并需要不确定性或风险敏感聚合的读者。它使后续工作可以在冻结编码器之上以较低训练成本(论文报告 RewardDiT 检查点训练约 1.54 GPU 小时)探索分布奖励头,并把奖励分布用于选择性预测、LCB 排序与 RLHF 训练信号。论文把自身定位为这一新范式的首次探索,其结论适用于所报告的数据规模、单一编码器与五个基准所覆盖的聊天、指令遵循、数学、代码、事实性与安全任务。

论文自述训练仅使用数十万开源样本,远低于工业级奖励模型的数千万偏好规模,且在绝对分数上尚未匹配最强开源标量奖励模型;研究固定了单一编码器与固定训练数据规模,跨骨干规模、模型家族与更大数据制度的行为仍待刻画。此外,DRM 与其他奖励模型一样可能继承训练数据偏差,并可能给风格上有说服力但事实错误或有害的输出打高分,若在缺少人工监督或安全约束的情况下作为优化目标,可能放大此类偏差。读者还需注意,本总结所依据的文本中部分表格数值以占位形式呈现,个别附录表格的完整数字无法核对,因此相关结论以正文明确给出的数值为准。

来源