ResonatorLM:用因果谐振场混合替代注意力实现高效长上下文语言建模
核心概要
该工作提出 ResonatorLM,用由阻尼谐振子构成的因果谐振场混合器替代自注意力,把词元序列视为受驱动的潜在场,训练与预填充走 O(T log T) 的因果 FFT 卷积、解码走固定尺寸循环状态;在约 6M 参数的匹配设置下,WikiText-2 字符级测试困惑度由 4.617 降至 3.764、准确率由 55.32% 升至 61.31%,32K 词元处解码相对优化注意力块达 6.47 倍加速,另有独立的核级基准在 8K 与 32K 处分别报告 440.29 倍与 575.86 倍。
Fig. 1. ResonatorLM block overview. A grouped input projection feeds a resonant mixing path that uses FFT convolution during training and prefill and fixed-size recurrent state during autoregressive decoding. A local causal convolution and head coupling complement the global resonant field before the output is passed to the MLP.
· 第 4 页深度剖析
提出以阻尼谐振子核替代注意力点积的因果混合器,同一核族在训练/预填充用因果 FFT 卷积、在自回归解码用固定尺寸循环状态。 相对线性/核化注意力与 S4、Mamba、Hyena 等仍源自注意力或状态空间范式的方案,这里把序列建模直接建立在受驱动潜在场与阻尼振荡动力学上,并让两种执行模式共享同一核参数。 论文给出核的显式参数化 k_h[t]=exp(−α_h t)cos(ω_h t+ϕ_h)、FFT 卷积式与循环更新式,并说明解码状态尺寸为 B×H×d_h×2 且不随解码长度增长;属于设计层面的形式化论证。
在约 6M 参数的匹配 WikiText-2 字符级设置中,质量优于匹配 Transformer,但训练吞吐更低。 相对匹配基线,测试困惑度从 4.617 降到 3.764(约 18.5% 相对下降),准确率从 55.32% 升到 61.31%(+5.99 个百分点),同时训练吞吐为 172,890 tok/s 对 262,610 tok/s。 主比较使用每个模型六个随机种子,并报告 95% 置信区间(困惑度 [4.561, 4.673] 对 [3.757, 3.772],准确率 [54.968, 55.674] 对 [61.239, 61.390]),两组区间不重叠。
长上下文效率随序列长度增长,解码在约 4K 至 8K 之间出现交叉点后转为明显更快。 在实用块级基准中,训练与预填充加速随长度单调上升,解码在 2048 词元处为 0.40 倍(0.6254 对 0.2532 ms/tok),8192 处转为 1.45 倍,16384 处 3.40 倍,32768 处 6.47 倍(0.6228 对 4.0296 ms/tok)。 该基准包含投影、状态/缓存构建与解码步开销,在单张 NVIDIA L4 上以 batch size 1、解码长度 128、两次预热后五次计时迭代测量;论文明确区分它与仅测混合器渐近行为的核级基准。
质量优势在多种数据、分词方式与更长上下文下保持,且不依赖单一脆弱超参数。 在 WikiText-2 字符/字节、WikiText-103 字符、TinyStories 字符/字节以及 WikiText-2 长度 512/1024 与 TinyStories 长上下文等设置中,ResonatorLM 均领先;消融中去掉头耦合或局部路径后困惑度跨度仅 0.021、准确率跨度仅 0.171 个百分点。 广度与长上下文研究每个设置三个种子;消融为六种子;论文同时报告物理诊断,最大前缀误差 7.75×10⁻⁷、学习到的半衰期范围 2.0 至 2048.0 词元。
启示与展望
该结果面向长上下文语言建模的效率与质量权衡,适用于论文所测的 WikiText-2、WikiText-103、TinyStories 等字符/字节级任务,以及约 6M 参数、最长 1024 词元质量评估与 32K 词元效率评估的设置;它使后续工作可以在更大模型规模、更复杂长上下文任务以及多模态等更广序列建模领域检验同一核族,也为关注解码内存随上下文线性增长问题的读者提供了一条可复现的替代算子设计。
读者仍会关注:在远超 6M 的规模与更复杂长上下文任务上,质量与效率趋势是否延续;与更新架构及更强系统级优化的对比会呈现何种图景;实用块级基准与真实生产环境之间的差距会如何影响实际加速;以及论文提到由 AI 助手协助起草、校对与形式化部分关键图表这一情况对细节呈现的影响。此外,本次读取为全文,但若图表中的具体数值未在正文完整复述,个别细节仍需回到原文核对。
