arXiv 2026年10月7日该工作构建了 CroissantMiner 基准,将 602 篇机器学习数据集论文(102 篇人工验证金标注、500 篇 LLM 银标注)与完整 30 字段 Croissant 1.1 模式配对,并用规则评分加人工审计 LLM 评判的两层框架评测 24 个提取系统,发现单次全文提取在每种骨干模型上都优于所评测的四种智能体架构,且长文本 RAI 字段最难提取,最强系统综合分仅 0.709。该工作构建了 CroissantMiner 基准,将 602 篇机器学习数据集论文(102 篇人工验证金标注、500 篇 LLM 银标注)与完整 30 字段 Croissant 1.1 模式配对,并用规则评分加人工审计 LLM 评判的两层框架评测 24 个提取系统,发现单次全文提取在每种骨干模型上都优于所评测的四种智能体架构,且长文本 RAI 字段最难提取,最强系统综合分仅 0.709。CroissantMiner 发布 602 篇论文基准:单次全文提取胜过四种智能体架构,最强系统综合分仅 0.709该工作构建了 CroissantMiner 基准,将 602 篇机器学习数据集论文(102 篇人工验证金标注、500 篇 LLM 银标注)与完整 30 字段 Croissant 1.1 模式配对,并用规则评分加人工审计 LLM 评判的两层框架评测 24 个提取系统,发现单次全文提取在每种骨干模型上都优于所评测的四种智能体架构,且长文本 RAI 字段最难提取,最强系统综合分仅 0.709。该工作构建了 CroissantMiner 基准,将 602 篇机器学习数据集论文(102 篇人工验证金标注、500 篇 LLM 银标注)与完整 30 字段 Croissant 1.1 模式配对,并用规则评分加人工审计 LLM 评判的两层框架评测 24 个提取系统,发现单次全文提取在每种骨干模型上都优于所评测的四种智能体架构,且长文本 RAI 字段最难提取,最强系统综合分仅 0.709。