跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Suan 直接在梯度层面构造偏好优化目标,在多种基线与基准上实现更强安全对齐且保持回答效用

该工作提出 Suan,一种新的偏好优化算法,其优化目标直接在梯度层面构造,绕过了标准的变分推导,从而获得更可解释、更稳健的训练动态;在多样化的竞争性基线与基准上的广泛评估显示,Suan 在实现更优安全对齐的同时完整保留了回答效用。