LexReward 用 Style、Element、Chain 三维度评分体系训练中文法律奖励模型,使 GRPO 在 Element 平均分上比 SFT 提升 6.04 分
相关研究与后续进展核心概要
该工作提出 LexReward,一个由法律专家参与构建、把法律回答质量拆解为 Style(词汇与句法)、Element(主体、事实、法条、裁判)与 Chain(推理顺序、完整性、正确性、非冗余)三个维度的分类体系,并据此设计规则或 LLM 评判的评分细则,用其构建偏好数据训练中文法律奖励模型 LexRM;实验显示评分细则能区分不同质量回答,DPO 在三个维度上均提升生成表现,LexRM 在测试时扩展中优于随机选择,用于 GRPO 时各维度均有增益并优于基于结果规则的奖励。
深度剖析
提出法律回答质量的三维分类体系,把高质量法律回答的要求拆解为 Style、Element、Chain 三个互补维度及其细粒度准则。 既有法律奖励方法多依赖整体性判断或只评估判决结果准确性等单一侧面,缺少对法律回答质量的结构化定义;该工作用法律专家自上而下的领域知识与自下而上的错误分析相结合,把质量要求显式化为可评估维度。 分类体系构建过程在正文第 3 节说明,包含专家参与、对多个模型在多个法律基准上回答与参考答案的对比分析,以及维度消融实验(表 3)显示聚合评分在三个维度上均取得最佳总体分数。
为每个细粒度准则设计可解释的评分细则,并按是否依赖输入上下文分别采用规则评分或 LLM 评判,实验表明这些奖励能可靠区分不同质量的回答。 相比整体偏好或单一结果奖励,该工作把奖励落到具体准则上,Style 用规则函数对照真实裁判文书语料校准,Element 与 Chain 视任务使用 LLM 评判或规则评分。 表 1 显示评分细则在三个数据集上均优于五模型平均或随机选择,例如 Style 的 CLASE 准确率 79.00 对随机 50.00;表 3 显示各子维度单独使用时总体分数低于聚合结果。
用评分细则导出的偏好数据训练出 LexRM,据作者所述是首个面向中文法律场景的奖励模型系列,并在测试时扩展中优于随机选择。 评分细则可能给出相同分数而形成并列,该工作用偏好对训练连续打分函数以区分细则难以区分的候选,并按维度分别训练奖励模型,再用任务算术合并为单一多维奖励模型。 表 1 中 LexRM-Style 在 CLASE 达 81.75、LexRM-Chain 在 LexChain 总体 50.46,均为各自数据集最佳,LexRM-Element 在 Legal 上排名第二;LexRM-Merge 在 Legal 上与 Element 专家模型相当并取得最高指控预测分数,但在 CLASE 与 LexChain 上低于对应专家模型。
评分细则导出的偏好数据用于 DPO 可提升三个维度的生成表现,LexRM 用于 GRPO 时各维度均有增益并优于基于结果的规则奖励。 当前法律强化学习几乎完全由可验证最终答案的结果奖励驱动,该工作显示按维度给出的奖励能监督通向答案的推理过程,而不只是估计答案本身。 表 2 中 DPO 在三个维度上均优于原始模型;GRPO (RM) 在每个维度上取得最高分,Element 上五项指标全部提升、平均分比 SFT 高 6.04 分;GRPO (rule) 的增益局限于最终答案,Element 与 Chain 的平均分基本不变。
启示与展望
该框架面向中文法律语境,分类体系与评分细则基于中文法律材料构建,评估也限于中文数据集,因此其结论适用于中文法律回答的生成与优化场景。它使法律领域知识可以直接指导奖励构建与模型优化:评分细则可用于区分回答质量,偏好数据可用于 DPO,LexRM 可用于测试时扩展的候选选择,也可作为 GRPO 的奖励函数分别优化 Style、Element 与 Chain。对希望在不依赖参考答案的情况下获得密集、可解释奖励信号的法律 AI 研究者与工程实践者,这一路径提供了可复用的构建流程。
分类体系与评估限于中文法律材料,对其他语言与法系的适用性尚未检验。该工作主要研究按维度分别给出的奖励,如何把多个维度合并为统一的评分细则奖励或奖励模型仍是开放问题,涉及聚合权重选择、偏好数据构成与训练策略。此外,评分细则可能给不同质量回答打出相同分数,偏好数据构建中所有候选同分的查询会被丢弃,这一处理对最终奖励模型覆盖范围的影响值得在后续工作中观察。本文为全文阅读,但图表以文本形式呈现,具体提示模板与部分实现细节位于附录,若需复现应结合附录与公开的数据和代码。
