跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

WakeKV 用可恢复 CPU 驻留替代冻结式 KV 压缩,在匹配内存下降低 miss rate 并提升吞吐

作者在三个模型(1.5B–8B)和三种任务场景(needle retrieval、长思维链、多轮回忆)中测量注意力头的读取行为,发现多数头在生成过程中至少改变一次读取行为,于是提出 WakeKV:一种反应式驻留策略,把降温的头移到可恢复的 CPU reservoir,而不是冻结或永久驱逐其状态;在匹配内存或预算下,WakeKV 相对冻结分类与破坏性驱逐一致改善 miss rate,并在 Mistral-7B 的 FlexiCache/vLLM 实现上提升吞吐同时保持 LongBench 质量。