跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

循环 Transformer 共享记忆:五次递归下验证困惑度较同规模标准 Transformer 降低 1.12-1.82,上下文记忆减少 76-79%

该工作预训练循环语言模型使其共享记忆——仅第一次递归写入键值缓存,后续递归读取该缓存并保留自身短窗口——在 150M-1B 参数规模上,其 Looped Prediction Transformer(LPT)及混合变体在五次递归时于 FineWeb-Edu 上相对同规模标准 Transformer 将验证困惑度降低 1.12-1.82,同时减少 76-79% 的上下文记忆,并通过分析发现共享记忆与局部记忆形成不同表征、后续递归主要关注共享记忆且共享记忆充当通往第一次递归的梯度高速公路。