跳到主要内容
返回时间线
arXiv来源发表:

CorpusMap 用实体页把语料库连成图,在 7 个模型 3 个基准上把答案质量提高 6.4–11.7 分并减少 34–57% 输入 token

核心概要

该工作提出 CorpusMap——一种离线构建、以反复出现的实体为锚点的语料库导航层,把每个跨文档实体渲染成带来源标注的 Entity Page 并链接到所有提及它的文档,在 7 个模型、3 个多文档问答基准(EnterpriseRAG-Bench、WixQA、HERB)上相比原始语料库的智能体搜索同时提升证据发现与答案质量,并平均使用更少 token,还优于 4 种替代导航层。

AI-generated editorial illustration: Follow the Entities: A Corpus Map for Agentic Search

深度剖析

CorpusMap 把语料库组织成实体与文档之间的二部图:每个被保留的跨文档实体对应一个 Entity Page,汇总各文档对该实体的陈述并逐条标注来源,同时链接到所有提及它的文档。 此前的 RAG 与 GraphRAG、HippoRAG 等把实体关系留在检索器内部,生成器只看到固定上下文;LLM Wiki 与 Corpus2Skill 等面向智能体的结构分别依赖模型自行决定页面或把文档归入单一主题分支。CorpusMap 的不同在于把实体—文档链接直接暴露给智能体,且这些链接由语料库本身决定、与查询无关。 论文给出形式化定义(式 1 的二部图)、四阶段离线构建协议(Cataloging、Extraction、Resolution、Rendering),并说明 Entity Page 以文件形式与原始文档并存,智能体可用同样的 shell 命令读取和搜索。

在 7 个模型、3 个基准上,CorpusMap 在答案质量与检索质量上均优于原始语料库智能体搜索,同时平均消耗更少 token。 摘要与正文报告:相比原始语料库智能体搜索,整体质量提升 6.4 至 11.7 分,GPT 模型平均少用 34% 至 57% 的输入 token;配对自助检验显示对每个基线、每个 GPT 模型均显著(95% 置信区间均高于零)。 主表覆盖 GPT-5.5、Luna、Terra、Sol 四个 GPT 模型,另在 DeepSeek-V4-Pro 与 MAI-Thinking-1 上复现同一趋势;基准为 EnterpriseRAG-Bench 的 80 个多文档问题、WixQA 的 79 个多文档问题、HERB 的 238 个内容型问题,语料规模分别为 2,819、6,221、6,365 篇文档。

CorpusMap 优于 4 种替代导航层,也优于 BM25、稠密检索、HippoRAG 与 GraphRAG 等检索式方法。 论文指出,其他组织方式(Document Page、Group Page、LLM Wiki、Corpus2Skill)并不稳定地优于原始语料库,说明单纯加一层导航并不保证提升;而检索式方法受限于一次检索返回的内容。 主表与泛化表给出各方法在三个基准上的文档召回、正确性、完整性、事实性、内容与 token 对比;检索式对比在 GPT-5.5 与 Luna 两个模型上进行。

地图可离线构建、跨模型复用、增量更新,并可用现成工具而非 LLM 构建。 论文报告:最便宜 LLM 构建的地图(成本 74.65 美元)对每个作答 LLM 都优于原始语料库;按时间顺序增量扩展地图时,每次更新比全量重建节省大量构建 token,最终地图质量与全量重建相当;用 GLinker 与 GLiNER 等现成组件构建的地图效果与 LLM 构建相当且成本更低。 复用实验跨 GPT-5.5、Sol、Luna、DeepSeek 四个构建者与四个作答模型;增量实验在 EnterpriseRAG-Bench 语料上按基准时间戳排序;现成工具实验在开源权重 Qwen3.8-27B 上同样优于原始语料库。

启示与展望

该结果面向证据分散在多个文档、且文档围绕人、项目、产品等反复出现实体生成的大型异构语料库,例如企业内部的工单、共享盘与聊天频道;论文用 EnterpriseRAG-Bench、WixQA、HERB 三个基准与固定语料验证,并说明地图可离线构建、跨模型复用、随语料增长增量更新,也可用 GLinker 等现成组件替代 LLM 构建。对只依赖单文档证据的问题,论文报告 CorpusMap 仍以更少 token 优于原始语料库。

论文的实体—实体边分析显示,这类边只缩短了二部图已有的路径,智能体仅在 11–19% 的问题中跟随它们,且 71% 的跟随未带来新的金标文档,同时使 Entity Page 平均增大 27–52%、输入 token 最多增加 28%,因此何种语料下需要更丰富的实体关系仍是开放问题。候选文件路径实验表明,去掉候选后智能体虽仍优于原始语料库,但探索 token 大幅上升,候选数量与质量如何影响不同语料尚待进一步刻画。伦理声明也提示,把同一实体的信息聚合到单一页面可能汇集原本分散的敏感信息或暴露越权文档,实际部署需按权限级别分别构建与提供地图。此外,本次读取的是论文全文与首页摘要,未包含图表原始数据与附录中的全部提示词细节。

来源