基于比较预言机的零阶偏好对齐:ComPO 方法
核心概要
本文提出并分析了一种基于比较预言机的零阶偏好对齐方法 ComPO,它不直接优化可微偏好损失,而是通过扰动当前策略并判断扰动是否提高偏好回答似然、降低非偏好回答似然来提取更新方向,从而利用低似然间隔的“噪声”偏好对;作者在平滑性、梯度稀疏性与预言机兼容性假设下给出了离线基本方案的收敛保证,并引入使用无标注策略生成进行反向 KL 控制的在线版本,在局部覆盖与分布内成对奖励精度下给出性能保证;在 Mistral、Llama、Gemma-2、Qwen3 与 Gemma-3 系列模型上的实验显示其相对现有直接对齐方法有所提升,包括长度控制胜率,成对似然诊断提供了与缓解似然位移一致的证据。
Figure 1: (Left) Percentage of nonzero entries in the final gradient as the gradient-entry threshold λ g \lambda_{g} varies. (Middle) Peak GPU memory used by ComPO for the three model families. (Right) Perturbed output-layer size and wall-clock time for completing 600 600 perturbations on 30 30 NVIDIA A40 GPUs.
arXiv深度剖析
提出 ComPO:把低间隔偏好对当作比较信号而非直接优化目标,用输出层扰动与逐项阈值化的实用离线实现来精炼已对齐策略。 与直接优化固定 DPO 式间隔损失的做法不同,该方法对每个扰动只取一位比较信号并聚合成归一化更新方向,使被过滤掉的低间隔对仍能贡献对齐信息。 论文给出算法描述(Algorithm 1 与 Algorithm 2)与在 Mistral-7B、Llama-3-8B 等模型上的基准结果,例如 DPO_clean+ComPO 在 AlpacaEval 2 LC 上由 9.41 提升至 11.66(Mistral-7B-Base)。
为基本离线方案建立最佳迭代收敛保证,为基本在线方案建立可行性保持与基于覆盖的性能界。 离线结果在平滑性、梯度稀疏性与预言机兼容性下给出比较查询数对维度仅呈对数依赖;在线结果在精确反向 KL 约束与局部覆盖下把性能差距与分布内成对奖励误差联系起来。 定理 3.2 与定理 3.4 给出显式概率界与误差界,附录 B 提供相应证明;这些是理论保证,其假设(如预言机与潜在目标兼容、局部覆盖)在正文中被明确列为独立条件。
在线扩展保留离线比较方向,仅用无标注当前策略生成来调整步长,并评估阻尼与回放的经验效果。 与在线获取新偏好标签或加入显式探索奖励的做法不同,在线样本只改变步长,不改变比较预言机或偏好标签。 表 10 显示加入阻尼后 Qwen3-4B-Base 的 AlpacaEval 2 LC 提升 1.23 个百分点、Gemma-3-4B-it 提升 2.07 个百分点,加入回放后三项指标进一步改善;作者说明实用方案是启发式近似,不被定理 3.4 覆盖。
成对似然诊断显示比较预言机更新使偏好回答似然不降、非偏好回答似然不升,与缓解似然位移一致。 该诊断直接检查每个噪声对在训练中的似然变化方向,而不仅依赖基准胜率。 表 2 在 Llama-3-Instruct-8B 与 Gemma-2-9B-it 上报告三次独立试验,例如 Llama-3-Instruct-8B 在 γ=1 时由 (-46.761, -47.410) 变为 (-46.728, -47.520);作者将其定位为训练内合理性检查而非总体性能保证。
启示与展望
该工作面向使用成对偏好数据对齐大语言模型的场景,尤其是参考策略对偏好与非偏好回答赋予相近似然的低间隔对;实用离线方案限定在输出层(lm_head)的稀疏条目更新,多层层扰动仅在消融中考察;在线方案面向可用无标注提示生成当前策略样本、并希望以反向 KL 代理控制偏离的设定。对希望以较低显存开销在已有对齐检查点上做任务特定精炼的实践者,这一框架提供了可复用的模块化路径。
读者仍会关注:低间隔对的筛选阈值 δ_margin 与更丰富判据(如 CHES)之间的关系,以及不同筛选标准下结论是否稳定;在线实用方案的长度归一化统计量并非序列级反向 KL,其阻尼与回放的经验收益是否在更大模型与更多任务上保持;Arena-Hard 上 Mistral-7B-Instruct 的下降与响应长度差异相关,但文中说明这本身不建立因果;此外,本文为全文加载,图表以文本形式呈现,若需核对图中曲线细节应回到原文。
