跳到主要内容
返回时间线
arXiv来源发表:

零数据自博弈预训练:生成器与学习器从随机初始化协同训练,在多个自然数据集上零样本损失随自博弈算力可预测地缩放

核心概要

该工作提出「零数据自博弈预训练」的概念验证:从随机初始化开始,一个生成器提出由通用图灵机解释的程序以产生字节序列,一个学习器以标准交叉熵自回归预测这些字节序列,生成器则用强化学习被训练去产出处于学习器能力前沿的序列,从而形成自适应课程;由于生成器与学习器都未在自然数据上训练,作者用自然数据上的零样本表现作为迁移的干净检验,结果在多个自然数据集上零样本损失随自博弈算力呈现可预测的缩放,模型还表现出上下文学习,并在训练中发现可识别的数学序列。

Source-provided article image: Self-Play Pretraining with Zero Data
Figure 1 ·

Figure 1: Self-Play Pretraining with Zero Data . Starting from randomly initialized models and using only synthetically generated data, self-play produces predictable scaling on held-out natural data. (Top) Our procedure casts synthetic data generation as search over the space of computable structure. A generator proposes programs, which are executed to produce byte sequences used to train a learner by next-token prediction. The generator is trained via reinforcement learning to propose programs near the frontier of the learner’s capabilities, measured by how strongly the learner’s gradients align with the learner’s recent learning trajectory with respect to an AdamW-preconditioned inner product. (Lower left) Self-play produces predictable improvements in validation loss with compute across natural datasets. We show the compute-optimal frontier over model sizes, number of self-play rounds, and ensemble sizes. (Lower right) The resulting learner exhibits in-context learning on held-out tasks without any gradient updates. We report empirical success under greedy decoding as a function of the number of in-context examples m m , averaged over independently sampled task instances.

arXiv

深度剖析

提出并实现了一种把合成数据生成表述为「在所有可计算结构空间上搜索」的预训练流程,灵感来自 Solomonoff 归纳。 以往预训练数据主要由人类为模型筛选与整理,该工作让模型自己生成最有利于自身改进的数据,理论上把训练数据来源从人类知识转为算力。 文中以通用图灵机解释生成器提出的程序来定义搜索空间,并说明该空间「几乎不施加领域特定结构」;这是方法层面的设计陈述,属于概念验证。

构建了生成器与学习器从随机初始化开始的双模型协同训练机制:学习器用标准交叉熵自回归预测字节序列,生成器用强化学习被训练去产出处于学习器能力前沿的序列。 生成器不是固定数据分布,而是被奖励去逼近学习器当前能力边界,因此形成随学习进展而变化的「自适应课程」。 文中明确给出两模型的训练目标(交叉熵与强化学习)以及生成器追求「学习器能力前沿」的设定,但摘要未给出具体算法细节、超参数或规模。

在多个自然数据集上,零样本损失随自博弈算力呈现可预测的缩放。 由于生成器与学习器都未在自然数据上训练,这一零样本表现构成对迁移的「干净检验」,把缩放规律从自然数据预训练场景延伸到了自生成数据场景。 文中报告「Across several natural datasets, zero-shot loss exhibits predictable scaling in compute」,但摘要未给出数据集名称、损失数值或拟合形式。

训练过程中模型表现出上下文学习,并发现可识别的数学序列。 这些能力是在没有任何自然数据监督、仅靠自博弈生成字节序列的条件下自发出现的,提示该流程能产生超出单纯拟合生成分布的行为。 文中以「exhibit in-context learning」和「discover recognizable mathematical sequences」陈述,属于定性观察,摘要未提供量化指标或示例。

启示与展望

该结果面向研究自生成数据预训练可行性的读者,尤其是关心数据来源能否从人类知识转向算力的研究者。它适用的设定是:生成器与学习器均从随机初始化开始、均未接触自然数据,评价指标是自然数据上的零样本损失随自博弈算力的变化。在这一设定下,它说明零样本损失可以呈现可预测的缩放,并伴随上下文学习与数学序列的发现。若要向前推进,可在同一框架下考察更大算力与更多自然数据集上的表现,以及生成器与学习器能力前沿的互动如何随训练演化。

摘要未给出自然数据集的名称与数量、零样本损失的数值或缩放拟合形式,也未说明模型规模、算力区间与训练时长,因此「可预测的缩放」的具体形态仍需看正文。上下文学习与「可识别的数学序列」在摘要中为定性陈述,缺少量化指标与示例。此外,本文自述为「initial proof-of-concept」,其结论在多大算力与多大模型上成立,是一个开放问题。本次仅基于摘要进行总结,未读取图表与实验细节,上述空白可能影响对结果强度的判断。

来源