FRAC 用分数阶动力学把 SSM 的指数遗忘换成幂律长记忆,1.3B 模型长上下文优于 Mamba 与 GDN
核心概要
该工作提出 FRAC,一种从分数阶动力学推导的选择性状态空间模型架构,用有限状态、对数间隔的指数模式之和逼近重尾分数阶核,把指数遗忘替换为幂律长记忆,在合成长尾与召回任务、1.3B 参数语言模型的长上下文评测以及 DNA 建模上优于 Mamba2、GDN、Mamba3 等 SSM 基线,同时在短上下文任务上保持竞争力。
深度剖析
FRAC 把分数阶微分方程的长记忆机制转成可并行训练、可自回归解码的有限状态循环层。 以往 SSM 多基于常微分方程,其动力学天然带来指数遗忘;分数阶微分方程虽能刻画重尾遗传效应,但是非马尔可夫的,状态依赖全部历史,无法直接用于有限状态循环层。该工作用对数间隔的指数模式有限和逼近目标幂律核,使分数阶记忆获得有限状态实现。 论文给出扩散表示定理与有限指数和逼近定理,并在 Proposition 3 中证明该模式组在关注时域上一致逼近分数阶微分方程解;实现上采用零阶保持离散化与分块并行扫描,并配有自定义 Triton 内核。
在受控合成任务上,改变记忆律本身即可显著改善长度外推。 重尾探测任务要求按固定幂律衰减累积稀疏事件,模型仅在长度 512 上训练,却外推到最长 128K;FRAC 的衰减最小,而注意力在约 8K 起迅速跌至接近随机。 单层、约 200K 参数、参数匹配的对照设置,对比 Mamba2、GDN、Mamba3 与自注意力;MADLab 上四层约 500K 参数模型在压缩、模糊上下文召回、记忆、选择性复制等任务上平均分 75.4,略高于 Mamba3 的 74.8。
在 1.3B 参数、100B token 从头预训练的语言模型上,FRAC 的长上下文表现优于强 SSM 基线,短上下文保持竞争力。 NIAH 评测把上下文推到远超 4K 训练长度的范围,FRAC 随长度增长下降更慢;LongBench 上平均比最强线性基线 GDN 高 1.9%,在 14 项任务中 8 项最佳。 所有模型参数量约 1.3B、使用相同训练协议与 Llama-2 分词器;短上下文 LM Harness 上 FRAC 平均仅落后 Transformer 与 Mamba3-MIMO 0.2%,困惑度与其他模型相当;召回检索任务中排名第三,落后 Transformer 2.1%、落后 Mamba3-MIMO 0.4%。
分数阶记忆的收益可迁移到基因组序列建模。 在 HyenaDNA 设定下训练 7M 参数因果语言模型,序列长度从短到长扫描,FRAC 在各长度上困惑度与 Mamba3、GDN 相当或更低,且更长上下文处增益更大。 使用 HG38 人类参考基因组与字符级 DNA 分词器,8 层解码器核心、隐藏维度与卷积核、头数一致,通过调整扩展因子把参数量匹配到约 7M。
启示与展望
该结果面向需要长程依赖的序列建模场景,包括长上下文语言建模、基因组序列、时间序列、视频以及智能体的持久记忆;对以短尾依赖、需要快速遗忘为主的任务,其优势可能减弱。方法保持线性于序列长度与有界状态,但计算成本随模式数增长,大规模使用需要在核函数设计与内存布局上投入工程。后续可把分数阶长记忆转移与 delta 规则式更新机制结合,以同时获得更强的长程归纳偏置与更精确的联想检索。
分数阶核由固定几何时间尺度网格上的有限指数和逼近,逼近质量取决于模式数与所选尺度范围是否覆盖任务所需依赖;论文的消融显示模式数降到 8 会持续变差,升到 32 仅带来同等或很小的提升却增加约 5% 参数与约 7% 计算。评测集中在长程依赖为核心的任务,视频、科学序列与智能体持久记忆等长时域场景仍待检验。召回检索任务按先前工作截断到 2K token,因而在该设定下更接近短上下文检索。此外,分数阶理论刻画的是逐 token 的记忆几何与零阶保持转移形式,选择性层在其上叠加内容相关的读写路由,属于对固定系统分数阶构造的架构推广。
