CroissantMiner 发布 602 篇论文基准:单次全文提取胜过四种智能体架构,最强系统综合分仅 0.709
相关研究与后续进展核心概要
该工作构建了 CroissantMiner 基准,将 602 篇机器学习数据集论文(102 篇人工验证金标注、500 篇 LLM 银标注)与完整 30 字段 Croissant 1.1 模式配对,并用规则评分加人工审计 LLM 评判的两层框架评测 24 个提取系统,发现单次全文提取在每种骨干模型上都优于所评测的四种智能体架构,且长文本 RAI 字段最难提取,最强系统综合分仅 0.709。
Figure 1: The CroissantMiner data-creation pipeline. (1) Corpus: ML dataset papers from top-downloaded Hugging Face datasets (vision, NLP, audio, etc.). (2) Extraction: a single-pass LLM generates 30-field Croissant metadata per paper, forming the silver split and the pre-fills for the gold split. (3) Annotation: annotators rate each pre-fill against the source paper on a 3-level rubric (Correct / Partially Correct / Not Correct) with failure-mode labels (e.g., hallucination, incomplete), producing 9,595 ratings over 3,060 cells. (4) Adjudication: majority vote resolves 95% of cells; senior-author review resolves the rest.
arXiv深度剖析
首个与社区标准模式对齐、端到端评测元数据提取的基准:602 篇数据集论文配 30 字段 Croissant 1.1 模式,其中 102 篇金标注由 22 名标注者给出 9,595 条评分,500 篇为 LLM 银标注。 此前评测数据稀缺且绑定各自模式(如 Masader、CardBench),不产出 Croissant 一致输出;该基准首次把科学论文与 Croissant-RAI 一致的金标注配对。 金标注采用预填加人工核验流程,每格至少三名标注者独立评分,多数投票解决 95.0% 的格子,其余由资深作者裁决;83.4% 的评分判定预填值完全正确,12.1% 的评分给出显式更正。
在固定骨干模型下,四种智能体架构全部低于单次全文提取:以 Claude Sonnet 4.6 为骨干,ReAct 0.652、Parallel Specialists 0.647、Triage + Critique 0.624、Locator-Extractor 0.566,均低于单次提取的 0.709,且差异在配对自助法与 Wilcoxon 符号秩检验下经 BH-FDR 校正后显著。 该结果覆盖角色分工、计划加自评、检索式上下文收窄与动态工具调用四类主流分解模式,并在 GPT-5.4 与 Gemini 3.1 Pro 骨干上重复出现,把差异归因于分解策略而非单一设计选择。 在 88 篇留出测试集上评测,综合分带 2,000 次论文聚类自助法置信区间;在论文已记录的 RAI 格上,单次提取仅 2.4% 返回空值,而四种智能体变体漏掉 10.9% 至 14.8%。
长文本 RAI 字段是最难的提取目标,需要跨章节综合而非单点复制,且智能体架构在 RAI 上的性能下降幅度大于核心字段。 该分析把提取难度定位到字段类型与文档稀疏度,而非论文长度:单次提取的得分随论文记录稀疏度下降,页数无可测影响。 金标注中 27.7% 的格子无记录值,RAI 字段(35.6%)约为核心字段(11.9%)的三倍;对 117 个智能体低于单次提取的抽样格分析显示,漏掉已记录字段占 44%,答案不完整占 34%,评判噪声仅占 5%。
单次提取同时是最省成本的方案:在匹配骨干的比较中,智能体配置每篇论文成本为单次提取的 1.2 至 7.8 倍,却未提升综合分。 该成本与准确率的联合结果说明,在所评测的预算档位上,任务分解并未换来质量收益。 成本由记录的 token 用量按标准公开标价估算,单次与智能体运行采用同一计价基准,并排除 token 用量未记录的论文。
启示与展望
该基准面向英文机器学习数据集论文与 30 字段 Croissant 1.1 模式,适用于作者提交时的草稿加复核流程:系统填满 30 个字段并把低置信字段回标给作者,作者只需复核经验上最弱的字段(如 sc:publisher、rai:dataCollectionType、rai:dataAnnotationAnalysis)。综合分 0.709 不足以支撑无人值守的元数据生产,但可作为面向作者的验证工具起点;在期刊与社区仓库集中部署、并对结构上可提取的字段使用确定性工具,可把每篇成本摊薄到多个用户。银标注分片支持蒸馏、微调与语料级覆盖趋势研究,金标注分片支持逐字段精度估计。
金标注源自 Claude Sonnet 4.5 预填,虽经人工核验与作者审计修正 3,060 格中的 191 格,但预填模型对“已填/空”的结构性模式仍被金标注继承,因此该模型被排除在排名之外;用 GPT-5.4 预填重标注 10 篇论文后其他系统排名稳定,但种子模型及其同族模型会获益,跨模型家族比较需谨慎。第二层评分依赖单一 LLM 评判者 GLM-5,其与人工共识的完全一致率为 71.5%,接近两名人工评分者彼此的 72.0%,分歧时通常更宽松,因此评判分数不能替代完整人工评测。部分 RAI 字段在测试集中记录格极少(rai:dataImputationProtocol 仅 2 格),这些字段的结果不宜过度解读;预训练污染无法完全排除。基准仅覆盖英文论文与 Croissant 1.1,向其他语言、领域与未来模式版本的扩展留待后续工作;视觉语言预处理读取表格与图片尚未测试。
