184位作者标注207篇论文的灵感来源,最强检索系统在191K语料中只找回48%的“催化论文”
核心概要
研究者构建了ScholarCatalyst基准:让184位作者为207篇近期计算机科学论文标注894个早期研究问题及其“催化论文”(曾启发或可能启发该项目的先前工作),在仅含项目开始前文献的191K篇语料上评测检索系统,结果最强系统Recall@20仅0.48,智能体搜索(0.42)不优于嵌入检索,即使训练数据可能已见过这些论文的Claude Fable 5.1也只达到0.51。
深度剖析
论文提出并公开了首个以作者亲身经历为依据的科学文献检索基准ScholarCatalyst,把“哪篇先前论文启发了这个项目”变成可评测的检索任务。 既有科学检索基准(SciFact、DORIS-MAE、ScholarQABench、LitSearch、MIR)评测的是论断支持、多面向相关性或引用意图,而该工作直接向论文作者采集公开记录中基本不存在的早期研究问题与灵感判断,包括作者当时并未读到的论文。 184位研究者、207篇2025–2026年计算机科学与AI论文、894条查询(207条核心研究问题CoreQ与687条子领域问题SubQ)、191K篇论文语料,每条查询附作者给出的正例、困难负例与理由;作者对重建问题的准确或基本准确评价为CoreQ 98.1%、SubQ 95.9%。
现有检索系统普遍找不全作者认可的灵感论文,且智能体搜索没有带来提升。 该工作首次在同一基准上横向比较稀疏、稠密、多向量检索与三类搜索智能体,并指出智能体受限于候选覆盖而非推理能力。 通用稠密检索器最强,CoreQ Recall@20为0.39、SubQ为0.51;科学文献检索器(SPECTER2、OpenScholar)在Recall@20上落后至少16点(CoreQ)与27点(SubQ);BM25与LateOn落后15–16点与18–25点;工具调用智能体0.42对嵌入检索0.48,grep智能体在搜索中只找到8%的金标查询–论文对,而工具调用智能体为46%。
“相似度”和“引用记录”都不是灵感的可靠信号,灵感关系本身是多样且情境依赖的。 作者理由的分类显示灵感常来自被改造的方法、支持方向的实证发现、迁移到新场景的想法或促使新方法的局限,超过一半的理由同时属于多种类型;而困难负例在词面与语义相似度上都不低于正例。 663条关键灵感理由按九类标注,平均1.69个标签,55.8%含两个及以上;43.6%的SubQ正例未被源论文引用,其中67.8%与源论文无共同参考文献;被引论文中仅46.2%(CoreQ)与34.0%(SubQ)带有uses或extends标签;同一篇先前论文在不同项目中可分别充当朴素基线、跨模态推广对象或结构性前提。
瓶颈在于“不知道该搜什么”,而非读不懂已找到的论文。 该工作通过候选注入、上下文消融与查询改写实验,把检索覆盖与识别能力分开考察。 检索器top-100覆盖70%的金标论文,智能体几乎找不到其余部分,约一半金标论文在任何一次搜索中都未被返回;加入源论文标题与摘要使CoreQ Recall@20提高0.11,而加入源论文参考文献提高0.35(参考文献本身含95%的CoreQ金标);让智能体读全文而非摘要,Recall@20变化不超过0.04;单查询扩展与多查询生成无明显提升,两种HyDE变体反而大幅降低召回。
启示与展望
该基准面向计算机科学与AI领域2025–2026年的论文,语料为191K篇、按每条查询的源论文发表时间做时间截断,评测设定为无网络访问、模型知识截止早于所有源论文;它适用于衡量“给定早期研究问题能否找回作者认可的灵感论文”,并可通过自动化流程随新论文持续扩充。作者指出两个后续里程碑:在某一领域内达到专家判断水平,以及跨多个领域行使这种直觉——因为作者认可的论文中有49.5%来自项目主题领域之外。
标签是作者对已完成项目的回溯性判断,可能受后见之明影响;任务本身的性能上限(skyline)仍是开放问题,作者以一篇论文上三位共同作者仅标约七个正例即覆盖第一作者43–60%标签、精确率84–88%作为初步参照。语料仅191K篇,远小于arXiv的三百万篇与Semantic Scholar的2.25亿篇,因此基准中的检索比真实科研场景更容易。此外,Claude Fable 5.1的训练数据可能包含源论文,其0.51的R@20只能作为宽松参照而非可比结果。
