跳到主要内容
返回时间线
Cohere Labs来源发表:

Cohere 提出 RCP-nDCG@10:用校准 AI 评审替代固定答案键,在 289 场盲测中 77% 与人类偏好一致,而传统 nDCG 仅 52%

核心概要

Cohere 提出 RCP-nDCG@10 检索评测方法,用校准 AI 评审对每篇检索文档按统一相关性评分标准打分,并结合成组比较与校准,从而为答案键未收录的相关文档记分;在 46 名标注者、273 个查询、289 场盲测对比中,两指标给出不同胜者时评审 70% 支持 RCP-nDCG,总体 RCP-nDCG 与人类偏好一致率 77%、传统 nDCG 为 52%,且其优势主要来自为答案键遗漏的相关文档记分(贡献 19 个百分点)。

AI-generated editorial illustration: RCP-nDCG@10: A more complete way to measure retrieval relevance

深度剖析

RCP-nDCG@10 用校准 AI 评审对每篇检索文档按同一套显式相关性评分标准打分,使答案键未收录的相关文档也能获得分数,同时保留传统 nDCG 的排序目标。 传统 nDCG 只把结果与既有 qrels 比对,而 qrels 通常由人工评审早期检索系统召回的文档子集构建;RCP-nDCG@10 改为对每篇实际检索结果按其真实相关性打分。 文中以 ViDoRe v3 一个真实查询为例:答案键只评了两篇文档,其中仅一篇进入系统前五;排在第 3 位的文档直接引用了答案,但因从未被评判而不算相关,nDCG@5 为 0.760,只反映五个结果中的一个。

该指标由两个信号合成:评审对每篇文档回答五个难度不同、对所有查询一致的 yes/no 问题,并在分组内两两比较估计各自胜出概率;比较确定顺序,评分标准把顺序放到所有查询共用的尺度上。 这不同于让 LLM 直接给每篇文档打一个分,因为单一 LLM 评分无法得到对所有查询含义一致的分数。 文中说明校准把两类信号结合,使相关性分数在每个查询上含义相同;这是方法设计层面的说明,未给出该合成步骤的独立消融数字。

在盲测人评中,RCP-nDCG 比传统 nDCG 更贴近人类偏好:两指标给出不同胜者时评审 70% 支持 RCP-nDCG;全部对比中 RCP-nDCG 选中评审偏好系统的比例为 77%,传统 nDCG 为 52%。 文中把优势归因于为答案键遗漏的相关文档记分(贡献 19 个百分点),而按相关性给文档打分再贡献 6 个百分点;两者存在交互,单独打分只增加 3.3 个百分点,因为它只能对答案键已列出的文档重新加权。 46 名签约标注者(每人至少相关领域学士学位)在不知道系统名称、排名和答案键的情况下给 NanoBEIR、BRIGHT、ViDoRe v3 查询的前五结果打分,每场对比由三名标注者评审、多数决定胜者,273 个查询共 289 场对比得出裁决;样本刻意过采样两指标分歧的对比,两指标一致时二者与评审一致率均为 87%。

RCP-nDCG 报告的差距幅度具有信息量:差距越大,评审越常同意,最大差距时一致率达 97%;差距约 0.02 以上时一致率 82%,低于该值则与抛硬币无异。 传统 nDCG 的差距幅度不具备同样性质:在最大差距时评审与其一致的比例只有 53%。 该结论来自同一批 289 场盲测对比的分层统计(文中 Figure 5),并在答案键覆盖度各层级上,两指标分歧时评审支持 RCP-nDCG 的比例为 64% 至 78%(Figure 6)。

启示与展望

该工作面向企业检索质量评测,适用于需要判断多个检索系统优劣、且答案键覆盖可能不足的场景,例如 MTEB、BEIR 一类基准以及模型选型对比。它使答案键未收录的相关文档也能获得分数,从而在模型能力超出旧标签表达能力时仍能区分系统;作者据此在下一代 Embed 与 Rerank 开发中选择以 RCP-nDCG@10 而非传统 nDCG 作为优化目标,并提示这些模型在旧 nDCG 下未必显得最强。对读者而言,这意味着当评测结论与旧指标冲突时,需要先确认所用指标是否覆盖了未被评判的相关文档。

读者仍需留意:RCP-nDCG 依赖校准 AI 评审,其判断质量与校准稳定性在文本中未给出独立评估;人评样本刻意过采样两指标分歧的对比,因此 77% 与 52% 不宜直接当作一般场景下的期望一致率。文中提到其他研究重标注标准基准时标注者间一致率低至 17%,而本研究报告同一文档两名评审在 0-4 分制上完全一致仅 42%,说明相关性判断本身带有主观性,任何单一指标都存在表达上限。此外,本文为方法介绍性文章,未展开论文中的技术细节,若需复现应查阅其论文与代码数据。

来源