跳到主要内容
返回时间线
arXiv来源发表:

800个模型预训练显示:野生AI网页文本在数据充足时抬高损失,31.1%的AI占比需多花1.6倍算力

核心概要

研究者用EditLens与Pangram标注2021至2026年的Common Crawl网页数据,发现2026年6月通过FineWeb质量过滤的token中有27.5%为AI生成、8月升至31.1%,并预训练800个19.9M至973M参数的模型、改变AI与人类token比例,拟合出含独立收益项与损害项的新缩放律:AI token对数据匮乏模型先降损失后饱和反转,对Chinchilla最优预算模型几乎立即抬高损失,该律在留出规模上预测误差低于11个已有缩放律,并据此估算按2026年8月AI占比训练需1.6倍算力。

AI-generated editorial illustration: How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

深度剖析

研究量化了“野生AI文本”在真实预训练语料中的占比与增长:2026年6月Common Crawl中通过FineWeb质量过滤的token有27.5%被Pangram标为AI生成,2026年8月为31.1%,而2021年6月不足0.1%、2024年6月为10.1%、2025年6月为16.1%。 此前关于AI文本影响的研究多基于模型自我递归训练(模型崩溃)或为提升特定领域性能而精心构造的合成数据;本文刻画的是第三种情形——由众多模型为人类读者撰写、未经标注地混入预训练语料、质量参差的“野生”AI文本。 基于对2021年1月至2026年8月每月5,000篇文档的Pangram 3.3.2标注样本,以及96.04M文档、83.31B token的WildAI语料;作者报告Pangram 3.3.2假阳性率0.05%、假阴性率1.99%,并在2021年爬取的60,000篇文档上测得0.062%被标为AI,作为假阳性率上界。

在800个模型(19.9M至973M参数)上,向固定人类语料中加入野生AI token的效果随人类数据预算改变符号:数据匮乏模型(低于约10个人类token/参数)加入AI token会降低人类文本损失,但收益随加入量饱和并迅速转为损害;在Chinchilla最优的20 token/参数及以上,AI token几乎立即抬高损失,而同等数量的新鲜人类token仍继续降低损失。 Chinchilla等现有缩放律把AI token与人类token等同看待,无法预测这种先益后害、且随人类预算改变符号的行为;作者提出含饱和收益项与对数增长损害项的新缩放律,在无AI文本时退化为Chinchilla。 800个模型共享同一nanochat训练配方,AI与人类文档按固定哈希顺序交错,每个AI或新鲜人类增量运行都使用其对照的人类文档、相同顺序与随机种子;在C4上留出规模(477M与973M)的配对误差为0.83,优于次优的Shukor联合律1.41与Chinchilla的4.32。

研究给出可操作的预训练数据建议:以2026年8月31.1%的AI占比训练未过滤网页文本,需要1.6倍算力才能匹配其人类子集在20 token/参数下的表现,按预测到2028年底升至3.0倍;重复人类文本优于加入AI文本;且应分别报告人类文本与AI文本上的验证损失。 作者进一步审计发现现有质量过滤反而偏好AI文本——FineWeb流水线保留AI文档的频率是人类文档的2.3倍,DCLM为9.8倍;并指出在22.3% AI占比的混合验证集上,95.5%的有害运行会被报告为改进。 过滤审计基于2026年Common Crawl的10,000篇文档样本;重复与加入AI的对比使用19.9M与35.8M模型在20 token/参数下各6个运行,在三个人类文本集上重复在全部18次比较中胜出,损失低1.7%至3.8%,而加入AI文本使损失升高0.2%至3.4%。

当目标本身是AI文本时,AI文本仍有价值:在AI生成文本上最优AI占比在各预算下均高于90%,作者拟合的律对第一个AI token的估值超过20个人类token;但训练于AI文本会改变模型写作风格,268M模型在20 token/参数下每千词AI典型短语从0.16升至0.36(AI占比1)与0.54(AI占比4),Pangram将故事标为AI的比例从18.6%升至37.2%。 这区分了“理解AI文本”与“写出AI文本”两件事,并说明混合验证集会掩盖损害,因为AI文本更易预测——553个加入AI文本的模型全部在AI标注文本上降低损失,其中44%在人类标注文本上升高损失。 风格分析基于12个留出的973M模型对500个WritingPrompts故事提示与WebText文章开头的续写,统计26个AI典型短语;CORE基准上AI文本与新鲜人类文本带来的提升相近(1.6对1.9分),但C4损失方向相反(升2.3%对降3.0%)。

启示与展望

该工作面向以人类文本为目标的英文网页预训练:它给出在给定人类token预算下应加入多少AI token、何时应过滤AI文本、以及何时应重复人类文本的判断依据,并释放WildAI语料(含AI、主题与格式标签)、全部800个模型与代码,使他人可在CPU上复现拟合与图表。对以AI文本为目标的训练(如智能体读取其他模型输出),结论方向相反,AI占比可高于90%。

缩放律在268M参数以内拟合、在973M以内测试,更大模型可能更多记忆训练数据、也可能把AI与人类文本学成互相帮助的相关任务,作者将这两点列为未来工作。研究只覆盖英文网页文本与Pangram标注,且以next-token损失为主要指标;在作者规模下AI文本对CORE分数的提升与新鲜人类文本相近,但作者指出这些模型都太小、不足以产生有意义的性能。此外,AI占比预测基于随机游走加漂移的外推,2028年底50.7%的估计带有区间;算力倍数(1.6倍、3.0倍)是该律的推断而非实测的大模型训练结果。

来源