跳到主要内容
返回时间线
arXiv来源发表:

字节跳动团队发现分块KV缓存压缩会让长上下文检索按压缩步长周期性变弱,DeepSeek-V4系列相位间准确率差距最高达40个百分点

核心概要

该工作提出并系统刻画了分块KV缓存压缩模型中的“相位敏感性”:同一信息在相对压缩窗口边界的不同相位上检索难度不同,DeepSeek-V4系列在128K上下文下相位间检索准确率差距最高达40.2个百分点,作者通过从零预训练23个压缩模型(Qwen3-0.6B骨干、100B token)复现该现象、用KV头与层级的均值替换消融揭示相位专门化、并用理想化归纳模型证明梯度流会驱动压缩门形成静态偏好,从而说明平均基准分数会掩盖周期性的位置性失败。

AI-generated editorial illustration: Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression

深度剖析

论文识别出一种此前未被报告的系统性失败模式:在采用分块KV缓存压缩的模型中,同一信息在相对压缩窗口边界的不同相位上检索难度不同,作者称之为相位敏感性,其周期跟随压缩步长。 此前关于长上下文失败模式的研究关注信息在上下文中的整体深度(如Lost in the Middle)或查询在片段中的位置,而这里关注的是源token的相位——一个每经过一个压缩步长就重复一次的坐标。 在DeepSeek-V4-Flash-Base的代码补全例子中,仅改变装饰性docstring长度(24至39个token)就让模型在正确补全“8”与错误补全“32”之间翻转,周期为4,与DeepSeek-V4的压缩步长S=4一致;在四个填充文本族共64个输入中,60个排序遵循该模式,而无分块压缩的DeepSeek-V3.1-Base在同样64个输入中只有4个把32排在8之上。

在受控的128K token针尖检索任务中,DeepSeek-V4系列各相位之间的检索准确率差距最高达40.2个百分点,且后训练只提高整体准确率、缩小差距,却不消除周期。 该测量把相位作为唯一被操纵的变量:各残差组的提示长度、查询位置以及目标位置的一阶和二阶矩都保持一致,因此组间差异来自相位而非位置统计量。 每个128K token提示包含16,000个键值对,目标为第249对;DeepSeek-V4-Flash-Base、Flash-0731、Pro-Base、Pro-0813各256个提示/残差组,最佳与最差残差组差距分别为40.23、19.14、34.77、14.84个百分点;DeepSeek-V4.1-Flash在每残差组2,560个提示下差距为6.09个百分点,其四个偶数残差组全部高于四个奇数残差组。

从零预训练的受控实验表明,分块压缩本身足以产生相位敏感性:23个压缩模型全部出现周期跟随步长的弱相位,而全注意力基线保持平坦。 DeepSeek-V4与标准Transformer差异众多,无法在不压缩的情况下重训;作者以Qwen3-0.6B为骨干、把分块压缩作为唯一实质性架构改动,并单独扫描窗口、步长、KV头数、门控、位置编码与局部记忆策略。 步长4、6、8、12分别给出约4、6、8、12的周期;全注意力基线在位置间的差距不超过6.1个百分点,而压缩模型在Prefix Padding下差距最高达78个百分点;在窗口8、步长8、8个KV头的配置下,压缩模型平均准确率59.4%接近全注意力的61.1%,但最差位置仅9.9%,基线为58.4%。

因果干预与理论分析给出机制线索:不同注意力头对不同相位贡献不对称(相位专门化),压缩门的静态偏好与头部起作用的相位对齐,而理想化模型中的梯度流会把每个头固定到单一相位。 此前工作已表明注意力头在检索中角色不同,本文进一步显示在压缩模型中这种角色还依赖相位,并把门控偏好与因果贡献联系起来。 在单KV头模型中,逐头均值替换显示某些头只在两三个相邻相位上重要(第9层在相位5和6、第10层在3和4、第14层在1至3);把门参数循环平移一个槽位会把弱相位移动一位(所示模型R²=0.98,五个模型、最多三个槽位的平移下为0.66至1.00);在理想化归纳模型中,定理表明最优压缩是最大程度集中的,梯度流使每个头的选择在所有输入上固定。

启示与展望

该结果面向使用分块KV缓存压缩的长上下文模型,尤其是DeepSeek-V4与DeepSeek-V4.1系列以及作者从零预训练的Qwen3-0.6B压缩模型;它给出的可操作建议是在报告长上下文准确率时按相位分组,例如在保持被查询信息不变的前提下把输入平移几个token。对读者而言,这意味着在评估或选型压缩模型时,除了平均分数,还应查看最差相位的表现,因为平均准确率接近全注意力并不保证没有系统性的位置性失败。作者也指出,显式协调各头与各层是否能让检索质量在相位间更均匀、同时不牺牲平均性能或压缩效率,仍是一个开放问题。

作者明确指出,机制结论在受控设定中最强,并不构成大型异构模型中相位敏感性普遍成因的证明;门控循环平移无法恢复边界相位,边界不对称与窗口内不对称的统一解释仍未解决。在DeepSeek-V4系列的针尖检索中,改变外层填充会同时移动目标与干扰项,因此这些比较并未把目标相位与干扰项相位独立变化,作者用预训练模型中的In-sequence Padding来检验这一点。消融方面,均值替换保留了一阶矩但不保证激活在分布内或范数匹配,也不能证明某个KV头独占存储了目标信息;从一次扫描中挑出最大损失属于探索性分析,作者未在留出提示上检验由门控提名的重要头。此外,代码补全例子是同一示例的平移变体,而非代码补全基准上的性能;DeepSeek-V3.1-Base的对比还伴随架构、训练与推理后端的差异。理想化理论依赖精确嵌入几何、固定嵌入与仅训练门参数等假设,且其动力学证明保证持续选择但不保证各头互补覆盖相位。

来源