跳到主要内容
返回时间线
arXiv来源发表:

约束违规不再一视同仁:8B模型按严重度学偏好,旅行规划通过率89.2%

导语

偏好优化开始按约束违规的严重程度给训练信号:一个8B模型在旅行规划上把硬约束通过率做到89.2%,接近多智能体系统的89.4%,而单次推理延迟从28.5秒降到2.1秒。

Source-provided article image: CM-DPO: Constraint-Margin Direct Preference Optimization for LLM Planning
Figure 1 · arXiv

正文

训练信号开始区分违规的轻重:预算超1美元和超1000美元不再产生同样的更新。 此前的直接偏好优化把被拒样本一律同等对待,隐式奖励差与失败严重程度无关。 在TravelPlanner的180条查询上,把二元偏好信号换成验证器给出的连续严重度后,通过率从64.1%升到72.6%。

硬约束与软偏好被拆成两级目标,硬约束先满足,软偏好在可行解内部再优化。 此前的方法把两类约束混在一个偏好信号里,可能用牺牲硬约束换取偏好得分。 在TravelPlanner上,该模型没有出现软偏好压过硬约束的错误,可行解内的软偏好得分为0.64,多智能体系统为0.72。

训练对由教师模型做最小编辑生成,只改动造成违规的实体,其余内容保持不变。 此前的蒸馏让教师整篇重写,学生容易学到措辞和长度这类表面差异。 最小编辑把平均改动从245个token降到32个token,在标准偏好优化下通过率从64.1%升到78.3%。

接下来

下一步可以检验这套严重度加权信号能否迁移到约束无法确定性检验的开放环境,以及能否在更小或更大的模型规模上复现。做智能体规划的工程师可以在有符号验证器的场景里直接采用两级目标,把硬约束的满足放在软偏好之前。

验证器可靠性审计中的一致率、假通过率与假失败率在材料里以占位形式给出,具体数值需要回到原文核对。预算违规占TravelPlanner失败的最大份额,长程规划中的隐式算术仍是待观察的瓶颈。教师合成数据的成本约为每1.5万对320美元,更大规模部署是否划算还需看后续的自博弈方案。

来源