人权值多少钱?ECtHR-NPD:预测非金钱损害赔偿金额的基准
核心概要
该工作构建了 ECtHR-NPD,一个包含 14,575 份欧洲人权法院判决、以名义欧元记录案件级非金钱损害赔偿(NPD)金额的基准,采用按时间划分的训练/验证/测试集与 ID/OOD/Challenging 三种诊断视图,并系统评测了常数预测器、梯度提升树、检索方法、微调编码器语言模型、提示式解码器语言模型与知识增强智能体六类方法,结果显示最复杂的语言模型与智能体方法并未稳定超越最强的特征基线,所有方法族在识别零赔偿案件与校准高额赔偿上都表现困难。
Figure 1: The ECtHR-NPD task. Models receive case metadata, violated Convention articles, case facts, and external macroeconomic covariates. Award-related material is excluded from model input. The model outputs the case-level non-pecuniary damage award.
arXiv深度剖析
将连续的非金钱损害赔偿金额预测形式化为回归任务,把法律 NLP 评测扩展到没有成文公式、由法院衡平裁量的金钱救济领域。 既有法律基准的监督目标多为分类、检索、抽取、生成或受法定区间约束的数值(如量刑、税额),而该工作首次以 ECtHR 第 41 条 NPD 金额为连续目标。 任务定义明确(输入为案件元数据、事实部分、被违反条款与宏观经济协变量,输出为非负欧元金额),并配有法律专家参与的目标构建与过滤流程。
发布 ECtHR-NPD 基准:14,575 个经校验的案件级目标、按判决日期的时间划分、三种诊断测试视图以及结构化标注。 数据来自 HUDOC 公开判决,经八项校验(赔偿头分离、按申请人求和一致性、货币归一化、可从执行条款复原等)并明确将目标构建材料与模型输入分离。 从 18,367 份英文判决经排除级联得到 14,575 例;训练 10,217、验证 1,461、测试 2,897;零赔偿理由分布有明确统计(finding_sufficient 占零赔偿的 58.2%,no_claim 占 36.1%)。
对六类方法族进行广泛比较与诊断式评测,发现更强的语言模型与智能体方法并不稳定优于特征基线,且所有方法族在零赔偿识别与高额赔偿校准上均表现不佳。 提供了按赔偿区间、测试视图、被告国与被违反条款的分解误差,暴露出既有分类导向法律基准未衡量的失败模式。 CatBoost 取得最低总体 MAE(€9,881),比训练集中位数低 10.2%;配对自助法显示 CatBoost 显著优于训练中位数与最强提示式语言模型,但与 BGE-M3 dense 或 ModernBERT late fusion 差异不显著;Challenging 视图 MAE 约为全测试集的两倍。
启示与展望
该基准面向英文 ECtHR 判决中第 41 条非金钱损害赔偿的案件级金额预测,适用于研究法律 NLP 中的连续金钱救济建模与校准评测;其目标为名义欧元金额,衡量的是对法院既有实践的拟合而非规范意义上的公正结果。数据与代码公开,可供研究者复现文档检索并在同一协议下比较异构系统。
读者仍可关注:目标构建在较旧判决与多申请人捆绑赔偿案件中可能残留标签噪声;第 41 条赔偿基于衡平裁量,同一事实下多个金额都可能合法,而点误差指标把偏离实际金额一律视为错误;提示式语言模型与 ReAct 智能体结果未做多次运行平均,存在运行间波动;2021 年后测试窗口包含较多与俄罗斯和乌克兰相关的案件,构成分布偏移。此外,本次解析为全文加载,图表与附录表格的细节以原文为准。
