跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

300M参数模型仅用合成先验预训练,在六种语言维基百科上把每字节比特数从8降到约1

作者提出Prior-Fitted Language Model(PFLM),一个3亿参数的字节级transformer,仅用由递归结构因果模型生成的合成非语言序列预训练,权重冻结时在上下文中学习预测真实文本:在英语、中文、印地语、阿拉伯语、日语、韩语维基百科上,每字节比特数随上下文增长从均匀的8比特降至一百万字节上下文时的约1比特,并在数字上学会计数、比较大小与近似加法,还能预测Rudin–Shapiro、Kolakoski与素数指示等确定性序列,并在源代码、分子、蛋白质、DNA、符号音乐与音频六个非文本域上压缩率低于gzip与PPMd。