arXiv 作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。
作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。
作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。
作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。