快手与南京大学提出BPS:为边界失败补上反向偏好对,使同一回答在错误处被拒、在正确处被选
核心概要
快手与南京大学提出双向偏好合成(BPS):对每个通过验证的边界失败,在原始提示下保留常规前向偏好对,并额外合成一个“已达成提示”下的反向偏好对,使同一回答在错误处被拒、在正确处被选;在Qwen3-4B-Instruct-2507上,BPS在保持原始侧成对排序的同时,将留出交叉锚点上的达成侧排序准确率从6.8%提升到62.3%,且不改变DPO目标、不训练奖励模型、不需要在线采样。
Figure 1: Forward-only DPO data rejects τ fail \tau_{\text{fail}} only under P orig P_{\text{orig}} . BPS adds an achieved-prompt reverse pair, so the same response pair teaches a prompt-conditioned preference boundary.
arXiv深度剖析
论文把“边界失败”重新定义为偏好数据构造问题:被拒回答并非本身不好,而是违反了给定提示却连贯地满足了邻近意图或约束设定,因此仅用前向监督会把“提示特定的拒绝”与“回答本身不可取”混为一谈。 此前基于纠正的离线偏好流程只把失败当作原始提示下的被拒回答;本文明确指出这种监督对边界失败是不完整的,并给出可操作的构造视角。 论文以带可验证原子约束的指令跟随任务为例说明该结构,并指出同类结构也出现在工具参数与多语言多轮场景中;作者将其表述为数据构造问题而非新的损失函数。
BPS对每个通过验证的边界失败同时保留原始提示下的前向对,并新增一个在合成“已达成提示”下的反向对,二者构成“交叉锚点”,使同一回答在错误处被拒、在正确处被选。 与机械修改约束的反向构造不同,BPS从学生实际失败的回答出发,合成一个独立、可读的已达成提示,并仅在通过资格与验证后才保留反向标签;与RPO/IOPO一类输入侧构造相比,BPS把每个反向对绑定到一个观测到的边界失败。 构造流程包含结果摘要资格判定、已达成提示合成与循环一致性验证;316个预筛反向候选中282个通过验证(89.2%),主实例共1,443个前向对加282个反向对(1,725对,反向密度0.195)。
在留出交叉锚点上,BPS在保持原始侧成对排序的同时显著改善达成侧排序:Gemini探针上达成侧成对排序准确率由6.8%升至62.3%,Kimi-K2.6跨教师探针上由9.3%升至61.6%。 前向DPO几乎不给出预期的达成侧排序,而BPS在不牺牲原始侧边界的前提下改变了奖励几何;预算匹配对照显示,复制282个前向对不改变6.8%,机械反转约束对仅升至32.9%,说明语义匹配的已达成提示是关键。 在146个Gemini流程留出交叉锚点上报告token归一化的DPO隐式奖励边际与预期符号比例;三个训练种子下BPS达成侧准确率均高于63%,而前向DPO维持在约8%;另有200个留出锚点的盲人审计显示99.0%的反向偏好方向一致、0.5%泄漏。
下游评测中BPS与Forward-DPO的差异在多语言多轮指令跟随上最明显,并在智能体/工具调用与代码检查上呈现一致的能力保持模式。 Forward-DPO在部分浅层指令跟随指标上有提升,但在多数FollowBench指标与较晚的Multi-IF轮次上低于Base;BPS在所列IFBench与IFEval各变体上均高于Base,并在每个Multi-IF轮次上高于两个对照模型,且BPS–Fwd差距随轮次加深而扩大(0.72、3.37、4.34)。 主比较在相同优化器更新步数(step 100)下进行;三个种子的IFEval平均分为87.79±0.23(Forward-DPO)对88.83±0.59(BPS);函数调用实例中BPS在完整调用准确率、达成侧偏好排序、达成提示精确匹配与联合边界成功上均呈方向性优势。
启示与展望
该结果面向使用标准DPO的离线偏好优化流程:BPS只改变偏好数据,不引入新损失、不训练奖励模型、不需要在线采样,因此可直接嵌入现有离线管线。方法适用于存在可验证约束或结构化动作空间的场景,论文在指令跟随与函数调用两个域中分别重建了完整流程,并指出各域需要匹配其输出结构的验证标准(指令跟随检查约束满足与泄漏,函数调用还检查可解析性、模式有效性、函数身份与参数值)。已达成意图以自然语言提示表示,便于被标准偏好优化管线直接使用;在形式化动作空间中也可同时保存模式或约束列表以便检查。构造成本从在线强化学习转移到离线数据构造:主构造运行约2,500次教师调用/5M token,而主DPO运行约0.2小时、1.6 GPU小时,全部微调预算约15 GPU小时,教师推理不计入GPU小时。作者说明这些步骤独立于DPO训练,可批处理、缓存,或在更大规模运行中替换为更便宜的验证模型。
达成侧排序准确率虽从6.8%升至62.3%,但BPS的达成侧绝对奖励边际仍然很小,作者据此将其表述为奖励几何的明显位移,而非完整的偏好反转。Gemini留出交叉锚点探针被作者视为奖励几何诊断而非教师无关的泛化证据,因此另设Kimi-K2.6跨教师探针作为补充。反向密度存在权衡:0.10给出较小纠正,0.30会降低IFBench,最终密度由验证结果自然确定并落在两者之间。函数调用实例使用不同的边界数据与检查点选择,其数字未与主IFBench训练比较混合。多数已验证锚点为格式/结构或词汇约束不匹配,内容意图与语言不匹配样本较少,因此失败类型分布分析被作者描述为描述性而非对全部可能边界失败的分布断言。此外,主结果采用固定step-100比较而非验证集选出的最佳检查点,较早的Forward-DPO检查点呈现不同的窄性能/能力保持权衡。
