SPIN用历史索引分数预测KV块重要性,在DeepSeek-V4上跳过30–40%索引器输入块并提升vLLM吞吐14.9%
核心概要
SPIN(Shadow Predictive Indexer)利用每个DSA层前几次解码迭代的索引器分数统计,沿垂直与对角模式维护EMA来预测KV块重要性,从而在索引器之前跳过部分上下文块;在DeepSeek-V4 Flash与Pro的长上下文与智能体基准上,30–40%块稀疏度下任务质量基本保持,集成到vLLM后输出吞吐最高提升14.9%、中位token间延迟最多降低13.2%。
Figure 1 : Indexer top- K K patterns from a single DSA layer on a prompt from summscreenfd . The y-axis represents decode iterations. The prompt is 9.7K tokens long, and 1,400 context KV slots are visualized along the x-axis. DeepSeek-V3.2 exhibits prominent diagonal bands and vertical lines, whereas DeepSeek-V4 exhibits mostly vertical patterns.
arXiv深度剖析
SPIN把索引器开销本身作为优化对象:它不改变核心注意力的固定top-k预算,而是在索引器之前按预测的块重要性裁剪索引器输入,使每步解码不再对完整KV缓存打分。 此前的索引器加速多依赖跨层复用(如IndexCache、GLM-5.2的层间共享)或分层过滤(如HISA),SPIN则显式建模索引器分数的时间模式,用逐槽位与相对偏移的EMA状态选择输入块。 在DeepSeek-V3.2与DeepSeek-V4 Flash上,用9.7K token的summscreenfd与94K token的AA-LCR两个诊断提示比较五种预测器;prev-iter的Pearson相关为0.913/0.902(V3.2)与0.876/0.849(V4 Flash),top-k召回为0.824/0.615与0.751/0.577,均高于prev-layer与随机基线。
SPIN在长上下文与智能体任务上以30–40%块稀疏度保持任务质量,并在MRCRv2上显示随机探索可在不增加块预算的前提下缩小与all-keep的差距。 该工作把稀疏度施加在KV块级别以适配paged-attention后端,并针对被跳过块无法获得分数更新导致的陈旧问题,在同一块预算内预留一部分位置做随机探索。 LongBench-v2上20%–50%目标稀疏度的分数与all-keep相差至多2.6%相对值;AA-LCR相差至多2.4分(3.7%相对值);RULER在50%稀疏度下p99 miss达48.83%但分数仅降1.24分;tau2-airline在30%稀疏度无退化,50%稀疏度降4.1%;MRCRv2在256K/512K/1M上无探索时差距随稀疏度扩大,5%随机探索明显收窄差距。
SPIN被实现进vLLM并作为一等公民处理投机解码:对多个验证查询预测块掩码并取并集,EMA更新推迟到接受结果已知后按前缀有效行回放。 这使索引器稀疏化与DeepSeek-V4原生多token预测(MTP)共存,而此前工作多聚焦于单查询解码路径或后置top-k算子加速。 离线回放60条MTP轨迹显示prefix-valid更新比row-0更新降低p99 miss 5.9–11.0%;SPEED-Bench在线评测中,所选策略在1,499条匹配请求上平均接受长度2.4097、草稿token接受率47.28%,与all-keep的2.4049/47.19%相差不超过0.0049与0.5%,同时保持39.51%实际块稀疏度。
端到端服务收益随目标稀疏度提高而更明显,因为SPIN自身开销基本固定。 这为长缓存智能体负载下的部署提供了可调旋钮:一旦支付固定开销,进一步减少索引器工作量更直接地转化为吞吐提升。 在8张NVIDIA B300(TP8/EP8)、507K缓存上下文与5K新输入、96并发请求各生成16K token的负载下,40%稀疏度输出吞吐+10.6%、中位ITL降9.2%;50%稀疏度+14.9%、降13.2%,从40%到50%吞吐增益提高40.7%。
启示与展望
该结果面向使用索引器式稀疏注意力(如DeepSeek-V4模型类)的长上下文与智能体推理服务场景,尤其是带长缓存前缀、高并发解码的vLLM部署;方法训练无关、不新增辅助层或网络,块级稀疏可直接对接paged-attention后端,并可与DeepSeek-V4原生MTP共存。对希望在不重训模型的前提下降低超长上下文解码延迟的推理工程师与系统研究者,SPIN提供了在固定块预算内以预测重要性选择索引器输入块的可复用设计,并给出块池化与探索策略的消融参考。
SPIN依赖历史索引器分数,对历史中未出现的突变注意力模式预测能力有限;被跳过的块不再产生分数更新,预测与观测之间存在自我强化的反馈,随机探索只提供再次被观测的机会,并不保证及时发现或完全恢复任务分数。当前评测集中于DeepSeek-V4及其原生MTP,其他索引器稀疏注意力模型与其他投机解码方法尚未验证。此外,MRCRv2在1M分箱中有三个超出模型上下文限制的样例保留零分,RULER因评测集庞大每种配置只运行一次,这些设置对分数波动的具体影响值得读者在复现时留意。
