RECLAIM 基准测试:四个智能体在 100 篇 NeurIPS 2025 论文上复现结果,最佳者仅复现 41% 的 Run 层论文、27% 的 Retrain 层和 15% 的 Reimplement 层
核心概要
作者提出 RECLAIM,一个由 100 篇 NeurIPS 2025 论文构成、可每年从新会议重建的基准,为每篇论文预先固定要复现的结果、成功复现的判定标准和 GPU 小时预算,并按作者公开物的完整程度划分难度层级(Run 层有代码、数据和权重;Retrain 层缺权重需智能体训练模型;Reimplement 层缺代码需智能体自行编写),由另一个语言模型依据日志和输出而非智能体自述来评分;四个智能体每篇论文各运行一次,各层级中表现最好的智能体分别只复现了 41%、27% 和 15% 的论文,失败尝试平均只用了 29% 的预算,最常见的错误是在 400 次运行中有 63 次未将方法任何部分与论文中的数字核对。
Figure 1: Overview of RECLAIM and its evaluation pipeline. The figure shows an example run with Qwen3.6-27B on the TTPL paper ( Chen et al., 2025d ) .
arXiv深度剖析
RECLAIM 把机器学习论文复现变成可预先定义、可逐年重建的基准:对 100 篇 NeurIPS 2025 论文,事先固定要复现的结果、成功判定标准和 GPU 小时预算。 以往对智能体科研能力的评测多依赖任务设定或事后判断,这里把复现目标、成功标准和资源上限在运行前写死,并让基准可从新会议重建。 基于 100 篇 NeurIPS 2025 论文的基准构建,论文摘要给出了规模、来源会议和预先固定的三类要素。
难度按作者公开物分层:Run 层有代码、数据和权重;Retrain 层缺权重,智能体需训练模型;Reimplement 层缺代码,智能体需自行编写。 把“作者释放了什么”直接映射为任务难度,使复现能力可以在不同公开程度下被分别衡量。 摘要明确给出三个层级的定义及其对应的公开物差异。
评分由另一个语言模型依据日志和输出完成,而不是采信智能体的自述报告。 将评判依据从智能体的自我汇报转向可核查的运行日志与输出,降低自述偏差对结果的影响。 摘要说明评分主体与依据,但未给出评分模型的具体身份或与人工评判的一致性数据。
四个智能体每篇论文各运行一次,各层级最佳表现分别为 Run 层 41%、Retrain 层 27%、Reimplement 层 15%;失败尝试平均只用掉 29% 的预算,最常见的错误是在 400 次运行中有 63 次未把方法任何部分与论文数字核对。 给出了跨层级、带预算约束的复现成功率与典型失败模式,显示公开物越少成功率越低,且多数失败并非耗尽预算。 摘要报告了四个智能体、每篇一次运行的成功率、平均预算使用比例以及 400 次运行中 63 次的错误计数。
启示与展望
这项工作面向需要评估或构建科研智能体的研究者与工程团队,适用于以论文及其公开物为输入、在固定 GPU 小时预算内复现指定结果的场景。分层设计使同一基准能分别刻画“有代码有数据有权重”“缺权重”“缺代码”三类条件下的复现能力,并可按年从新会议重建,便于持续跟踪进展。
摘要未说明评分所用语言模型的具体身份、评分与人工判断的一致性,也未报告多次运行或不同随机性下的波动,因此 41%、27%、15% 这些数字的稳定性尚不清楚。失败尝试平均只用 29% 预算,说明多数失败并非预算耗尽,但摘要未解释智能体为何提前停止。此外,本次仅基于摘要,未读取论文正文、图表或附录,基准构建细节与错误分类的完整定义仍需查阅原文。
