一篇综述用59条发布记录和11个开源权重端点,把注意力演进重写成上下文记忆的组织问题
核心概要
这篇综述以“模型内部上下文记忆”为统一分析单位,提出记忆表示、记忆更新、访问、读出与整合五个维度,梳理Softmax注意力、稀疏注意力、线性注意力、状态空间模型与混合架构五条研究线,并用截至2026年9月22日的59条发布级记录(覆盖14个主要模型谱系)和11个高性能开源权重端点的冻结对比,说明注意力设计在走向多样化而非收敛,混合与跨层复用正在把网络深度变成组织上下文记忆的一个维度。
深度剖析
综述提出五维分析透镜——记忆表示、记忆更新、访问、读出、整合,分别追问历史信息以何种形式保留、如何变化、哪些对当前查询可用、如何被读取、多个读出如何合成模块输出。 以往综述多按架构家族、计算复杂度、长上下文策略、状态动力学或KV缓存管理来组织文献,这里改用功能角色作为共同词汇,使Softmax注意力、稀疏注意力、线性注意力、状态空间模型与混合架构可以在不还原为同一计算模型的前提下相互比较。 该透镜以公式化的抽象算子(记忆模式、更新、访问视图、读出、整合)逐一定义,并配以术语与符号表;作者明确说明五个维度是功能可区分但不必正交或独立实现,属于分析性框架而非通用计算图。
机制层面,显式记忆路线与状态路线起点不同但控制范围不断扩大并出现重叠:显式路线以记忆表示与访问为主,逐步延伸到有界或多分辨率记忆的更新、路由分数或摘要估计影响读出、以及头协调与门控的整合;状态路线以记忆表示与更新为主,通过多行、多槽、分段与状态组扩展容量与时间分辨率,使访问、读出与整合变得更显式。 综述把线性注意力的更新规则统一分解为保留/衰减、擦除/纠正、写入/提交三类角色,并给出从无衰减、固定衰减到输入依赖衰减,从无显式擦除、耦合纠正擦除到解耦擦除,从直接写入、纠正写入到擦除—写入解耦的演进表;同时用逐token目标函数把同一批递推规则解释为在线优化。 该结论建立在逐方法的统一更新公式与对照表之上,覆盖Linear Transformer、DeltaNet、RetNet、GLA、RWKV-5/6/7、HGRN2、GDN、Lightning Attention-2、DeltaProduct、KDA、GDN2、EDA等,并配有容量扩展(SSE、SDM)与时间扩展(Log-Linear Attention、DLA、MHLA)的对比表。
架构层面,公开记录的LLM注意力设计呈多样化而非收敛:59条发布级记录中58条可分类,32条保留单一主导注意力或记忆家族,26条被归为混合;混合记录从2022—2023年的0条,增至2024—2025年的9/25,再到2026年的17/27,主要形式是局部/全局显式注意力调度与循环状态/显式注意力调度。 综述把机制层面的梳理与两类架构证据连接起来:一是纵向发布清单,二是2026年9月22日冻结的11个高性能开源权重端点横截面;后者显示前沿同时存在完整GQA、潜在压缩稀疏注意力、块稀疏注意力、局部/全局或压缩的稠密/稀疏混合,以及循环状态层与完整、潜在或稀疏显式检索的组合。 纵向清单基于官方论文、技术报告、模型卡与已发布配置,架构披露不足的记录标记为未披露而非推断;作者明确说明清单为有目的筛选而非穷尽或按市场份额加权,排行榜分数还受模型规模、训练、后训练、推理预算与系统实现影响,因此只用于刻画采用与共存,不用于因果归因。
跨层复用把协调从模块摆放扩展到记忆与路由产物的深度生命周期:GLM-5.2与GLM-5.3通过IndexShare/IndexCache复用检索索引或Top-k候选决策,DeepSeek-V4.1-Flash通过CSA2的Full、Reindex、Reuse三种模式复用选定的全局KV表示与索引键,LongCat-2.0与LongCat-Flash-Lite-Sparse用LSA的跨层索引复用某一层选定的token集合。 这引入了一个区分:能力摆放回答哪些记忆功能在不同深度运行,产物生命周期协调回答哪些记忆或路由产物跨层持续存在、何时被复用或刷新;在2026年的27条记录中有5条带跨层属性,对应GLM、DeepSeek与LongCat三个架构模式。 该结论来自清单中带跨层属性的5条发布级记录及其对应的公开技术文档;作者同时提示跨层属性与单一/混合分类重叠,不应把跨层计数与单一、混合两列相加。
启示与展望
该综述面向自回归LLM及密切相关的因果序列混合器的模型级机制,覆盖截至2026年9月22日公开可得的工作;测试时学习、外部数据库检索、多模态专用记忆设计与纯实现层优化不在核心分类内,除非直接改变模型的上下文记忆语义。纵向清单为有目的筛选而非穷尽或按市场份额加权,架构披露不足的记录标记为未披露;前沿对比是2026年9月22日的冻结快照,用于刻画采用与共存而非因果归因。五维透镜是分析性词汇,作者明确说明维度不必正交或独立实现,因此适合作为比较与设计检查表,而非统一计算图。
综述提出的状态化多维记忆路由仍是前瞻假设,其可行性取决于写路由与读路由在同一地址空间上的联合协调,以及稀疏写与稀疏读的预算分配,文本未给出该假设的实证验证。跨层复用目前仅见于5条发布级记录、对应三个架构模式,其收益与适用条件仍需更多公开案例。清单与前沿对比是特定时间点的描述性证据,排行榜分数受模型规模、训练、后训练、推理预算与系统实现影响,因此无法据此判断某一注意力机制导致更高质量。此外,本次读取为全文,但图表以占位形式出现,图中节点填充、上下文长度分层与具体可视化细节无法核对,涉及图14至图15的细节判断应以原文图表为准。
