跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

LexReward 用 Style、Element、Chain 三维度评分体系训练中文法律奖励模型,使 GRPO 在 Element 平均分上比 SFT 提升 6.04 分

该工作提出 LexReward,一个由法律专家参与构建、把法律回答质量拆解为 Style(词汇与句法)、Element(主体、事实、法条、裁判)与 Chain(推理顺序、完整性、正确性、非冗余)三个维度的分类体系,并据此设计规则或 LLM 评判的评分细则,用其构建偏好数据训练中文法律奖励模型 LexRM;实验显示评分细则能区分不同质量回答,DPO 在三个维度上均提升生成表现,LexRM 在测试时扩展中优于随机选择,用于 GRPO 时各维度均有增益并优于基于结果规则的奖励。