轨迹特征未能提升末层注意力路由:六项预注册比较在 SmolLM3 与 Qwen3.5 上均无正向增益
核心概要
该研究在冻结的 SmolLM3-3B-Base 与 Qwen3.5-4B-Base 上,用成对的末层注意力启用/旁路执行产生带符号的下一词损失差,检验隐藏态外推误差、曲率和误差变化能否在不确定性、一步位移、位置与状态投影之外改进注意力路由;在 PG-19 的 100 本留出书籍、固定 20% 因果调用配额下,六项预注册比较经 Holm 校正后均无正向增益,Qwen3.5 中参数匹配的固定投影对照反而比轨迹路由器降低 NLL 0.00356 nats/token。
Figure 1: Paired final-attention utility and controlled routing. Both branches receive the same preceding-trunk output and retain their corresponding final feed-forward computation. Primary features use the bypass state. Every compared router receives the same signed utility supervision. The prefix-only quota uses frozen calibration thresholds and allocates 99 calls among 495 scored positions. Incoming-state routing is a separate secondary experiment.
arXiv深度剖析
在冻结的 SmolLM3-3B-Base 与 Qwen3.5-4B-Base 上,末层注意力的启用相对旁路分别降低 PG-19 平均 NLL 0.03813 与 0.16614 nats/token,但效用为正的比例仅为 48.04% 与 72.06%,说明平均收益不足以决定在哪些位置调用注意力。 以往自适应计算与记忆选择工作多比较端到端架构或不同的保留目标;这里固定骨干与可选操作,用同一前缀上的成对执行给出带符号效用,从而把“注意力是否有用”与“在何处调用”分开。 两个公开基座检查点、每本 PG-19 书两个 512 预测块、排除前 17 个位置后每块 495 个评分位置、每检查点 99,000 个测试预测,配额固定为 20%。
六项预注册比较在 Holm 校正后均无正向增益;在 Qwen3.5 中,参数匹配的固定投影对照 C_RP3 相对轨迹路由器 J32 降低 NLL 0.00356 nats/token(95% 区间 0.00218–0.00487),且所有六项比较的同时上界都低于预设的 0.005 nats/token 实际讨论阈值。 该对照在头部容量与输入维度匹配的条件下比较,把轨迹特征的增量价值与更简单的当前状态投影区分开,而不仅是与标量基线比较。 特征、拟合、预算与六项对比在收集现代测试效用之前锁定;三个拟合种子、10,000 次整书自助抽样、种子 217、Holm 校正。
次级结果依赖被移除的操作、特征位置与评分视野:局部 32 位置注意力在 SmolLM3 与 Qwen3.5 中分别恢复全注意力相对旁路平均增益的 54.8% 与 93.8%;在 4,096 预测视野下,未强制阈值下 J32 激活率从 20.46% 升至 86.86%(SmolLM3)和从 18.71% 升至 35.55%(Qwen3.5)。 这些分解表明,移除末层注意力与仅扣留其直接远距离读取需要分别评估,且冻结阈值在更长视野下会显著漂移,使未强制 NLL 变化不适合作为匹配预算证据。 次级分析使用同一测试书籍的中点序列,与核心块可能重叠,作者明确标注为视野偏移分析而非独立书籍队列。
实际选中查询执行在长序列上带来小幅延迟下降但 NLL 上升:4,096 预测下 I_S35 相对原生速度比为 1.043(SmolLM3,95% 配对块区间 1.013–1.060)与 1.029(Qwen3.5,1.024–1.050),执行 NLL 分别增加 0.00925 与 0.11014 nats/token;缓存续写中所有学习路由器都更慢且 NLL 更高。 该测量把分配质量与实测推理收益分开,并披露旁路特征会重复计算可复用的前馈与词表头工作,因此测得的开销包含可避免的实现成本。 100 个计划策略–条件中 99 个通过预检,提供 2,970 次计时执行;30 个随机配对块、五次预热;SmolLM3 长度 1,024 的 I_S35 因超出 0.001 nats/token 容差而未计时。
启示与展望
该工作面向需要在固定预算下决定是否调用末层注意力的研究者与工程实践者,适用于冻结基座检查点、教师强制前缀、已知评分视野与固定 20% 调用配额的设定。它提供了可复用的成对干预与因果配额协议,以及区分分配质量与实测延迟的测量框架;对未知长度服务、自由生成反馈、优化融合内核下的端到端效率,以及更大或不同预训练家族的模型,结论的适用范围需要另行检验。
读者仍会关注:秩 32 状态投影与固定拟合配方作为学习器的能力边界,以及主要结果是否排除了所有轨迹信息的条件独立性;单一检查点每家族与重叠的视野偏移队列无法区分参数规模、架构与预训练的影响;截止期配额假设已知视野,其强制末位决策与观察到的阈值漂移使未知长度服务仍未解决;教师强制固定前缀排除了生成 token 的反馈;执行测量在共享 Windows 桌面图形与参考 PyTorch 回退下进行,绝对生产性能与最优融合内核表现尚未测试。
