跳到主要内容
返回时间线
arXiv来源发表:

Invent-A-Dataset 在零数据条件下生成后训练数据集,质量相对提升 17%、多样性相对提升 19%

核心概要

该技术报告提出 Invent-A-Dataset——一个从数据集描述出发、以提示为基础生成真实且大规模后训练数据集的系统,并在零数据设定下与 Anthropic、Google、OpenAI、DeepSeek、Zai 五个前沿模型 API 对比,覆盖八类任务、数据集规模最高 20K 样本,报告其质量相对提升 17%、多样性相对提升 19%,且多样性优势随规模扩大(200 样本时持平,20K 样本时相对提升 37%),并带来下游后训练模型性能提升,其微调在不同后训练模型架构上排名更高。

Source-provided article image: Invent a Dataset: Measuring dataset generation abilities with zero seed
Figure 1 ·

Figure 1 : Diversity vs. quality trade-off. Quality (x-axis) versus diversity (y-axis), measured by DCScore with τ = 0.05 \tau=0.05 , for four external models and the Invent API. Both scores are averaged over eight 5K-sample datasets in unconstrained setting. Higher is better on both axes; the upper right is optimal. The Invent API attains high quality and high diversity simultaneously.

arXiv

深度剖析

提出 Invent-A-Dataset,一个以提示为基础、从数据集描述直接生成真实且大规模后训练数据集的系统,面向“零数据”这一最极端也最常见的设定。 相对于把数据集构建视为高度人工、脆弱的流程,该工作把“从描述到数据集”的生成过程本身作为可评测的能力来对待。 技术报告形式,摘要给出系统定位与评测设定,未在可见文本中给出实现细节。

在八类任务、数据集规模最高 20K 样本的评测中,Invent-A-Dataset 同时取得最高质量(相对提升 17%)与最多样样本(相对提升 19%)。 与五个前沿模型 API(Anthropic、Google、OpenAI、DeepSeek、Zai)对比,报告的是质量与多样性同时占优,而非单一指标取舍。 摘要报告相对增益数值与对比对象,具体评测协议与统计细节未在可见文本中展开。

多样性优势随训练数据集规模扩大而增强:200 样本时与对比方法持平,20K 样本时相对提升 37%。 把规模作为变量纳入观察,指出优势并非固定,而是随数据量增长而扩大。 摘要给出两个规模点的对比数值,中间规模趋势未在可见文本中说明。

上述质量与多样性优势转化为下游训练收益,Invent-A-Dataset 微调在不同后训练模型架构上排名高于其他生成器微调。 把生成数据集的指标与后训练模型的实际表现联系起来,而不止于数据集层面的度量。 摘要报告下游训练增益与跨架构排名结论,具体模型、任务与排名依据未在可见文本中列出。

启示与展望

该工作面向的是“零数据”设定:实践者手中没有目标能力的数据,只有数据集描述。在这一前提下,Invent-A-Dataset 被定位为从描述生成真实且大规模后训练数据集的提示式系统,适用于需要快速获得后训练数据的开发场景,评测覆盖八类任务与最高 20K 样本的数据集规模,并报告其微调在不同后训练模型架构上的排名表现。对希望减少人工数据构建、在无种子数据时启动后训练流程的团队,这一设定直接对应其工作条件。

可见文本为摘要,未包含图表、任务清单、提示设计、质量与多样性的具体度量方式,也未说明五个前沿模型 API 的调用配置与对比公平性设置。因此,17%、19%、37% 等相对增益所依据的评测口径、样本构造与统计显著性,以及“下游训练增益”和“跨架构排名更高”的具体模型与任务,仍需在正文中确认。规模趋势目前只给出 200 与 20K 两个端点,中间区间的变化形态也是开放问题。

来源