iS-KV用块增量SVD在线压缩KV缓存,在DeepSeek-R1-Distill-Llama-8B上以4.06倍压缩保留82.6%准确率
相关研究与后续进展核心概要
该工作提出iS-KV,一种面向长程推理的在线低秩KV缓存压缩方法:它保留最近窗口为精确表示,将较早状态增量折叠为有界秩表示,并在低秩基演化时同步历史坐标以维持表示一致性;在DeepSeek-R1-Distill-Llama-8B上以4.06倍持久KV压缩达到82.6%准确率(原模型83.6%),在Qwen3-8B上以5.64倍压缩达到89.2%准确率,并在匹配内存预算下持续优于token驱逐基线。
Figure 2: Overview of iS -KV. The KV cache grows while iS -KV keeps the recent window of w w tokens exact (teal) and folds older tokens into a compact low-rank history (blue), one U Σ B ⊤ U\Sigma B^{\top} per block. Every b b tokens, the pending block F F (orange) is merged in by a Block Incremental SVD that updates basis and coordinates together and solves only a small core, independent of the history length n n . Each position can be reconstructed for query q t q_{t} attends to all t t positions.
arXiv深度剖析
提出iS-KV,将SVD低秩压缩从固定prompt缓存扩展到在线解码场景,通过保留最近窗口精确、把较早状态增量折叠为有界秩表示来控制KV缓存增长。 既有KV缓存压缩多依赖token驱逐,而不可逆删除可能移除后续推理需要回访的历史状态;SVD低秩压缩保留全部位置但此前难以用于在线解码。 摘要说明其设计为在线低秩压缩,并给出在DeepSeek-R1-Distill-Llama-8B与Qwen3-8B上的准确率与压缩倍数结果。
识别出在线低秩压缩中的历史漂移问题:若为新token更新基而旧token保留旧基坐标,存储的历史会显著漂移。 该观察解释了为何把SVD压缩直接搬到在线解码并非易事,并成为方法设计的依据。 摘要以“Through our investigation, we find”陈述该发现,未给出具体漂移量化数值。
在低秩基演化时同步历史坐标与更新后的基,以维持表示一致性。 这一坐标同步机制针对上述漂移问题,使在线增量更新基的同时保持历史表示可比。 摘要将其描述为方法的核心机制,未提供消融或误差分析细节。
在长程推理任务上实现高压缩比下的准确率保持,并在匹配内存预算下优于token驱逐基线。 结果显示低秩在线压缩可作为token驱逐之外的一条可行路线,且不依赖不可逆删除。 DeepSeek-R1-Distill-Llama-8B上82.6%对原模型83.6%、4.06倍压缩;Qwen3-8B上89.2%、5.64倍压缩;并称在匹配内存预算下持续优于token驱逐基线。
启示与展望
该工作面向长程推理中的自回归解码场景,适用于需要控制KV缓存内存、又不希望不可逆删除历史状态的推理模型部署。方法设定为保留最近窗口精确、将较早状态折叠为有界秩表示,并在基更新时同步历史坐标。摘要给出的适用证据来自DeepSeek-R1-Distill-Llama-8B与Qwen3-8B两个模型,以及与其对比的token驱逐基线。
摘要未说明压缩倍数的具体度量口径、内存预算如何匹配、评测任务与样本规模,也未给出坐标同步的消融或漂移量化。读者仍需关注:在更长解码长度或不同模型规模下准确率与压缩比的稳定性,以及低秩基更新频率与秩上界如何选取。原文为摘要级信息,图表与实验细节未包含在已加载文本中,这些细节会影响对方法适用范围的判断。
