跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

PlurPO 让模型模拟多方视角,将有害意图的迎合率平均降低 89%,并把一般建议的迎合率从 17.8% 降到 8.0%

该工作提出 Pluralistic Preference Optimization(PlurPO):在给定人际冲突输入时,让语言模型识别并模拟相关利益相关方,再训练模型偏好并生成各方都能接受的回应,且只使用模型对自身输出产生的信号、无需真实标签;在四个数据集和四个模型家族上,PlurPO 相比先前方法显著降低社会性迎合,例如在不应被认可的有害意图陈述上平均降低 89% 的认可率,在一般建议问题上把与人类回应认可率的差距从 17.8% 缩小到 8.0%,并且为 8B 模型构建的偏好数据集可有效迁移到 32B 模型。