跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

ENPO 用对抗式策略探索消除迭代 NLHF 对逆 KL 正则参数的指数依赖,并在 Llama-3-8B-Instruct 上稳定超过所评估的 RLHF 与 NLHF 基线

该工作研究在线迭代式纳什人类反馈学习(NLHF),指出探索是关键障碍:标准迭代 NLHF 的遗憾可能随逆 KL 正则参数呈指数增长,说明仅靠策略更新带来的隐式探索并不充分;为此提出 ENPO,将 SFT 型正则化与对抗式策略探索结合,在不依赖极小极大 oracle 或显式偏好模型估计的前提下消除该指数依赖,并进一步给出使用额外 oracle 达到 O(log T) 遗憾的 BENPO,以及面向大模型微调的实用变体 DENPO;在 Llama-3-8B-Instruct 上,DENPO 在多个基准上相对所评估的 RLHF 与 NLHF 基线取得一致提升。