300M参数模型仅用合成先验预训练,在六种语言维基百科上把每字节比特数从8降到约1
相关研究与后续进展核心概要
作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。
深度剖析
PFLM在从未见过任何真实语言文本的情况下,仅凭上下文前缀就能预测自然语言,每字节比特数随上下文增长从8降至约1。 此前所有语言模型无论课程多么合成,都训练于自然语言;作者称据其所知,尚无先前工作展示仅用构造的非语言先验预训练后能在上下文中预测自然语言。 在六种语言维基百科上测量每字节比特数随上下文的变化,权重全程冻结,模型只通过上下文适应语料。
该先验的样本复现了自然文本的统计特征:Zipfian词频、缓慢的熵率收敛与多尺度长程依赖。 先验是构造而非拟合的,其样本与自然文本处于同一统计邻域却不共享任何具体文字系统;消融显示固定所有节点每步更新会保持标量指纹不变,但使长程互信息积分下降18%,说明多速率更新调度承载了跨多步依赖。 与四个无数据比较器(均匀、Zipf、随机bigram、随机隐马尔可夫模型)对比,并对照六种语言维基百科各500条4096字节序列;长程互信息分析配合固定更新率的消融实验。
同一模型在数字上学会计数(含进位)、比较数量级与近似加法,并预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列。 这些能力出现在一个仅用合成先验预训练、从未见过数字或这些序列的模型中,且比较与加法的准确率随数量比下降,呈现人类近似数量感的距离效应。 计数按精确匹配评分并按是否进位分组;比较与近似加法为少样本设置,每格若干查询,按比值分箱;确定性序列报告每符号比特数随序列长度的变化。
在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上,PFLM的每字节比特数均低于bigram、gzip与PPMd。 同一组权重无需针对各域训练即可跨域压缩,优势在DNA上最小、在音频与音乐上最大。 与三种通用压缩器在同一批域数据上直接比较每字节比特数。
启示与展望
该结果适用于权重冻结、仅通过上下文适应的设定:模型在评测中从不做梯度更新,只靠前缀推断生成源。上下文长度是当前的主要限制,训练上下文为一百万字节(约二十万英文词),作者指出在该长度下维基百科上的预测仍不及训练于数万亿token的现代语言模型。作者预期两条后续方向最有价值:把该先验用于数据稀缺的领域,如低资源语言、未破译文字或动物交流;以及在真实文本与先验样本上联合预训练,以增强常规语言模型的上下文学习。
先验的哪些成分对迁移到自然语言最关键,文本中只给出了固定更新率消融这一条线索,其余组件的作用仍是开放问题。评测覆盖六种语言与六个非文本域,但上下文长度止于一百万字节,更长上下文下曲线是否继续下降、以及能否缩小与常规语言模型的差距,尚待观察。数字任务的准确率随数量比下降,其与人类近似数量感的对应是类比性的,文本未给出跨物种或跨任务的直接比较。此外,本材料为全文,但部分图表数值在正文中以区间形式呈现,具体数值需查阅原图与附录。
