AutoDataBench 让智能体逐条交付训练任务:五个前沿智能体在 45 分钟内得分均不超过 20 分,难度校准而非模式覆盖成为瓶颈
核心概要
该工作提出 AutoDataBench,把“智能体能否写出可被数据流水线逐条验收的训练任务”变成评测目标:给定一个原始基准任务和目标模型尝试它的记录,作者智能体须为同一套件写出一个新任务,评分由门控、目标模型通过率是否落在区间、以及对隐藏行为模式清单的覆盖三项相乘;在三个可执行智能体任务基准上,五个前沿智能体在默认 45 分钟预算下得分均不超过 100 分中的 20 分,把最强智能体的时间放宽到四倍后得分大幅提升而单个可用任务的成本几乎不变。
深度剖析
论文把“单条合成任务的验收”本身设为评测对象,而不是用训练后的模型表现做代理。 此前评测要么要求交付训练好的检查点(如 PostTrainBench),要么用训练后的增益衡量环境生成(如 RSIBench-Data 仍给检查点打分),而数据行业实际是按样本交付、按标准逐条验收;AutoDataBench 在训练之前、以单条任务为单位给出判定。 论文以表格逐项对比了 AutoBencher、BenchAgents、InnovatorBench、PostTrainBench、RSIBench-Data 与 AutoDataBench 在“交付物、是否针对弱点、是否逐条判定、难度是否落在区间、是否无需训练、覆盖领域”上的差异;评测单元为一个 episode,作者智能体只交付一个任务目录。
在默认 45 分钟预算下,五个前沿作者智能体得分均不超过 20 分,主要损失来自难度校准而非模式覆盖。 论文报告 kimi-k3 为 0.184、gpt-5.6-sol 为 0.177、qwen3.8-max 为 0.139、glm-5.3 为 0.130、deepseek-v4-pro 为 0.097;落在通过率区间内的交付比例在 14.6% 到 25.0% 之间,而通过门控的交付对隐藏清单的覆盖高达 0.700 到 0.967。 每个原始任务在默认预算下被撰写两次,24 个原始任务来自三个套件各 8 个,目标模型固定为 deepseek-v4-pro,评分取两次 episode 的均值;论文称这一“覆盖高、难度差”的分裂与预期失败方向相反。
把最强智能体的时间预算从 45 分钟放宽到 180 分钟,得分从 0.184 升到 0.552,且每个可用任务的成本几乎不变。 论文报告三个套件同向改善,最弱的 Terminal-Bench 提升最多;落在区间内且通过门控的交付比例从 0.900 升到 0.960,说明并非靠复述原任务进入区间;单位成本为 11.88 美元对 12.62 美元、244 分钟对 230 分钟。 该对比固定了目标模型、清单、评判者与评分,但论文明确说明 180 分钟一组同时使用了最高推理强度设置,两个变量一起变动,因此把结论读作方向性判断而非倍数测量。
作者智能体的排名不跨领域稳定,且成本与得分排序不一致。 kimi-k3 在 AutomationBench 第一、在 Terminal-Bench 第四;qwen3.8-max 在 AutomationBench 得零分而在 Terminal-Bench 第一;glm-5.3 在 Terminal-Bench-Science 得零分。一个可用任务的价格在 4.81 美元到 27.69 美元之间,而 kimi-k3 与 gpt-5.6-sol 得分相差不到 0.01,成本却相差数倍。 论文给出逐套件得分图与逐智能体的分钟、美元成本表,并指出每套件仅 8 个任务,因此逐套件数字应读作固定子集上的估计。
启示与展望
该基准面向可执行智能体任务的数据生产场景:任务须以套件原生目录格式交付,包含指令、可执行环境与判定器,作者智能体可读取套件约定、原始任务与目标模型记录,但只能调用目标模型。它适用于按样本验收、在训练之前判断数据是否可用的流水线,覆盖终端操作、软件工程、科学计算与跨应用业务工作流四类工作。论文把任务刻意收窄为“为同一套件写一个结构相似的新任务”,因此结果说明的是这一最简形式的数据生产,而非从零发明领域、格式或质量标准的能力。对使用智能体撰写训练数据的团队,论文给出的可操作含义是按领域而非一次性选定作者智能体,并把时间预算视为可调资源。
质量项背后的假设尚未被检验:论文明确指出,一个能激发被测行为模式的任务是否真能产出修复该模式的训练数据,仍属未测。时间预算对比中,180 分钟一组同时使用了最高推理强度,两个变量一起变动,论文因此把该结论读作方向性判断。逐套件数字基于每套件 8 个任务的固定子集,应视为该子集上的估计。此外,本次载入的是论文全文与附录,但图表中的具体数值以正文叙述与表格文字形式呈现,若需核对图中细节仍需查阅原文。
