跳到主要内容
返回时间线
arXiv来源发表:

AutoDataBench 用三个固定训练任务测出:Kimi-3 数据智能总分 60.68 最高,但检索 ID 领先的模型在隐藏分布上反而垫底

核心概要

该工作提出 AutoDataBench,一个在固定训练流程与资源预算下隔离“数据智能”的受控测试台,覆盖工具调用数据诊断修复、检索数据组织与知识注入三类任务,评测七个前沿大模型在迭代实验中的数据决策能力,并发现智能体整理的数据在工具调用与检索上接近专家参考、但分布内高分不保证分布外迁移,同时把优化轨迹复用为中期训练数据可提升下游编码表现。

AI-generated editorial illustration: AutoDataBench: A Data-centric Testbed for Accelerating Auto Research

深度剖析

AutoDataBench 把数据决策从训练框架、超参数与算力中隔离出来,用三个任务分别对应数据诊断与修复、数据组织、数据构建:工具调用任务在约 4 万条经七种概率性污染算子处理的数据上训练 Qwen2-1.5B-Instruct,检索任务在 RLHN 集合上以 InfoNCE 对比学习训练 6 层 MiniLM,知识注入任务用冻结教师对 13B Talkie 做离线特权上下文蒸馏。 既有自动研究基准往往允许多条改进路径并存,难以归因到具体研究能力;该工作固定训练流程、工具与源数据,只让智能体改数据,并额外设置隐藏的分布外评测来识别“刷榜”行为。 每个任务给出明确的源数据规模、基座模型、训练目标与资源上限(单张 A800、24 小时、最多 20 轮训练评测),并配有随机基线与专家参考两档对照。

七个前沿模型在工具调用数据修复上接近专家水平:平均分布内准确率 80.82–81.98,高于随机基线 70.45,接近专家参考 81.65;但迁移到 BFCL 时全部超过随机基线 55.18,却都低于专家参考 60.23。 这说明智能体能在未被告知污染标注的情况下发现并修复参数、函数标签、schema 与查询—调用对齐等结构性与语义性错误,但修复策略的迁移收益仍有缺口。 每个模型—任务组合做三次独立标准运行,共 63 次运行,报告三次均值与样本标准差,并单独报告分布外分数。

检索任务出现明显的分布内与分布外排名反转:GPT-5.6-Sol 分布内均值 40.46 接近专家参考 40.62,但分布外仅 26.15 为最低;Qwen-3.7-Max 分布外最高为 30.18,而所有模型都低于专家的 34.76。 这直接展示了被目标任务反馈偏好的数据策略未必在未见分布上保持优势,为“benchmaxxing”提供了可测量的证据。 分布外分数在优化全程对智能体隐藏,只在用分布内反馈选出的检查点上评测,五个分布外检索数据集取平均。

把 AutoDataBench 的优化轨迹当作中期训练数据,在 5B token 预算下加入 8M token 轨迹(上采样十倍后占 1.6%),五个编码评测全部提升,其中 CRUXEval 输入预测从 72.00 升到 74.12、SWE-bench Multilingual 从 27.67 升到 33.33,而 MBPP 与 LiveCodeBench 增益较小。 基准不再只是评测工具,其轨迹本身可作为训练数据来源,且增益集中在需要回溯程序行为与诊断陌生代码库的任务上,与轨迹中“检查证据、形成假设、在变化上下文中行动”的结构相近。 控制组与处理组在相同 5B token 混合、相同 SFT 数据与随机种子下对比,唯一差异是中期训练是否包含自动研究轨迹。

启示与展望

该测试台面向希望在固定训练流程下单独考察数据决策能力的研究者与工程团队,适用于工具调用、检索嵌入与知识注入三类数据问题,以及单卡 24 小时、最多 20 轮训练评测的资源设定。其可插拔框架允许把任务、训练框架与工具按需替换,因此结论可被后续工作扩展到其他学习范式与数据模态;轨迹复用为中期训练数据的做法,则为把评测过程转化为训练资源提供了可复制的路径。

预测启用运行在六组模型—任务组合中有四组最佳分数低于标准运行均值,知识注入上的差距最大,显式预测是否构成额外负担、以及预测准确性与优化表现之间的关系,仍是开放问题。轨迹复用实验只在一个 14B 基座与 5B token 预算下进行,增益是否随规模与数据混合变化尚不清楚。逐次运行的改进统计包含检查点选择与训练波动,未隔离反馈本身的因果贡献;工具调用与检索的分布外评测也显示迁移缺口,其来源值得进一步观察。

来源