BiasReducer 只改奖励头:五个奖励模型在三个偏见基准上平均提升 8.3/18.0/6.9 个百分点
核心概要
该工作提出 BiasReducer,一个只编辑线性奖励头、不重训奖励模型的轻量框架:先用带语义监督的稀疏自编码器式编码器学习长度、自信、谄媚等预设属性的内部表示,再为每个属性确定调整奖励头的方向与幅度并存入编辑库,最后针对新数据集按属性对奖励分数的影响力排序并选择相应编辑;在五个奖励模型上,BiasReducer-M 使 RM-Bench-Hard、Arena-StyleConflict、JudgeBiasBench 平均提升 8.3、18.0、6.9 个百分点,优于两个基于训练的基线,并在下游 best-of-n 选择与 GRPO 训练中减少冗长与谄媚而保持质量可比。
深度剖析
BiasReducer 把奖励模型偏见缓解拆成三步:用 SAE 式编码器学习与预设属性对应的可解释坐标,学习如何降低奖励头对每个属性的依赖(方向与幅度),再为新数据集选择要施加的编辑。 既有编辑方法需要事先指定目标偏见并施加固定修正,训练类方法则需要重训与额外数据;该工作把“如何修正”与“修正哪一个”分离,使同一批编辑可复用而无需重训或预先指定偏见。 论文给出完整方法推导(含与线性概念擦除 LEACE 的关系)与消融:去掉行为监督使属性轴相关从 0.55 降到 0.17,去掉干预监督使符号准确率从 0.99 降到 0.75。
在五个奖励模型(Qwen3-1.7B、GRM-3B、Mistral-7B、InternLM2-7B、GRM-8B)与三个偏见基准上,BiasReducer-S 平均提升 6.2、15.7、6.0 个百分点,BiasReducer-M 提升 8.3、18.0、6.9 个百分点,且在每个模型–基准组合上都优于原始奖励模型。 相对更强的训练类基线 RRM,BiasReducer-M 在三个基准上再高出 4.1、13.2、2.3 个百分点;相对固定谄媚编辑或源数据选出的最强固定编辑,数据集特定选择带来更大增益。 主表覆盖 5 个模型 × 3 个基准的逐格数值,Arena-StyleConflict 由 Arena Human Preference 140K 构造的 1000 对样本组成,结果在种子 0 与 1 上平均。
编辑方向与幅度都需要“奖励感知”:用协方差方向而非 SAE 解码器向量,三个基准平均增益从 0.5/0.4/0.6 个百分点升至 6.2/15.7/6.0;为每个属性单独选择编辑幅度优于全局共享幅度(JudgeBiasBench 上 Mistral-7B 从 8.4 升至 11.8 个百分点)。 这说明仅识别出可解释属性并不足够,编辑方向还需反映该属性与奖励表示的关系,且不同属性适合不同的编辑强度。 方向与幅度的对比在五个奖励模型上分别报告,并给出均值行;属性选择在 100 条样本时与全量池决策一致率 89%,200 条时升至 97%。
增益可迁移到下游:用编辑后的 Mistral-7B 奖励头做 best-of-n 选择与 GRPO 训练,Qwen3-4B 与 Llama-3.2-3B-Instruct 的冗长与谄媚下降、词数减少,而由 Claude Sonnet 5 独立评判的质量保持可比。 把奖励模型层面的鲁棒性提升与策略层面的行为改变连接起来,显示减少表面属性依赖不会以明显牺牲回答质量为代价。 下游实验固定候选池或训练配置,仅替换奖励头;质量、冗长、谄媚由独立评估器分别打分,训练结果在 80 轮后于 100 条留出提示上评估。
启示与展望
该结果面向使用标量奖励模型的 RLHF 与响应选择流程:编辑只作用于线性奖励头,其余参数固定,因此适用于奖励头为线性结构的已训练奖励模型。方法预设了七个可测量属性(长度、冗长、格式、表情/感叹号、自信、模糊措辞、谄媚),并依赖源偏好数据学习表示与编辑方向、依赖源验证集选择编辑幅度;新数据集上只使用其响应、隐表示与原始奖励分数,不使用偏好标签。对希望在不重训、不预先指定偏见的前提下降低奖励模型表面属性依赖的团队,这提供了一条可复用的编辑库加数据集特定选择的路径。
属性集合是预先定义的七类,未覆盖的表面属性是否同样可被这套编辑处理仍是开放问题;编辑选择是转导式的,需要新数据集的响应与原始奖励分数,在完全在线、逐条到达的场景下如何操作尚待观察;下游质量由 Claude Sonnet 5 作为独立评估器判定,评估器本身的偏好是否影响结论值得继续关注;此外,附录中部分消融表格在本次读取的文本里为空表,逐模型的细分数值无法核对,只能依据正文报告的均值与代表性结果。
