信息满足度:以读者为中心的摘要评估新维度
核心概要
本文提出以“信息满足度”(查询加读者画像)作为摘要评估的新维度,通过五类扰动测试与一项专家人工评估发现,ROUGE、BERTScore 等传统指标以及 Llama-3.3-70B、Prometheus-7B 等 LLM 评判指标大多无法通过基本扰动检验,且与读者偏好的一致性接近随机水平,说明现有指标不足以衡量摘要对特定读者的信息满足度。
Figure 1: Annotation workflow example. Steps 1c-1d continue for each query assigned to the annotator.
· 第 5 页深度剖析
提出“信息满足度”这一以读者为中心的评估维度,用查询加读者画像(角色、领域、信息需求)来刻画摘要是否解决了读者查阅原文的特定信息需求。 以往评估把质量视为摘要自身的固定属性,或只关注风格偏好;本文把读者背景作为跨查询稳定、可复用的信号显式纳入评估框架。 概念性贡献,配合 4 个科学摘要语料(arXiv、PubMed、SciTLDR、eLife,每个子采样 N=50)上的扰动实验与 20 名标注者的人工评估加以操作化。
多数流行指标无法通过基本扰动检验:在“不同受众”改写上,几乎所有指标不敏感甚至反向;在“增量添加”上,ROUGE-1/2/L、BLEU、chrF、METEOR、compression 出现 −0.56 至 −0.65 的负相关,即不完整摘要得分反而更高。 把此前针对 ROUGE 的长度敏感性失败模式扩展到 BERTScore 与多数 LLM 评判维度,并首次系统检验受众改写这一维度。 基于 Spearman 秩相关与单调性统计,在 4 个语料、N=50 文档上对多类指标做受控扰动,并给出通过阈值(方向性 |ρ|≥0.4,稳定性 |ρ|≤0.2,单调性 M≥0.5)。
LLM 评判指标在不同评判模型间高度不一致:在 Llama-3.3-70B 下通过的维度,在 Prometheus-7B 下常常失败或反向;在“不同受众”测试中,Prometheus-7B 的 fluency、informativeness、overall 与 FActScore 甚至给出 0.80–1.00 的正相关。 揭示 LLM-as-judge 的结论对评判模型选择高度敏感,而非稳定的质量信号。 同一批指标在两个评判模型下并行运行,直接对比其 Spearman ρ 与匹配率 M。
专家人工评估显示,没有任何指标族与读者偏好的一致性显著超过随机水平:传统指标 α 在 −0.029 至 0.173 之间,Prometheus 评判在 −0.150 至 0.158 之间,Llama 评判在 −0.179 至 0.053 之间;专为捕捉信息满足度设计的 persona precision 与 persona recall 反而表现最差(Prometheus 下均为 α=−0.150)。 把指标评估从“与通用质量标注相关”推进到“与特定读者在特定查询与画像下的偏好相关”,并证明加入画像信息本身并不足以解决问题。 140 个查询会话、20 名标注者、420 次成对比较,采用 Krippendorff's α 衡量指标与标注者选择的一致性。
启示与展望
该工作面向科学文献摘要场景,评估对象是查询加读者画像条件下的信息满足度,适用于需要为不同背景读者(如研究者、临床医生、学生)生成或评估摘要的研究与工程实践。扰动测试框架、标注平台与人工标注数据已公开,可供后续研究在此基础上设计新的评估指标或扩展到其他领域与语言。
人工评估中标注者来自专业网络、样本量为 20 人,其偏好分布是否代表更广泛读者群体仍是开放问题;扰动测试使用 Llama-3.3-70B 生成改写,改写质量本身可能影响指标响应;persona precision 与 persona recall 的失败提示瓶颈可能在于如何度量满足度(如信息重要性加权、读者已有知识的建模、摘要间的比较判断),而非是否提供画像信息,这些方向尚待后续研究验证。
