跳到主要内容
返回时间线
arXiv来源发表:

MILO 用块级低秩压缩把多示例上下文 KV 缓存最多减半,Qwen2.5 上吞吐提升 1.8 倍且分类与推理性能几乎不降

核心概要

该工作提出 MILO 压缩框架,利用多示例上下文中的低秩冗余,以块为粒度压缩 KV 缓存,并按信息熵动态分配秩预算,在 Qwen2.5 模型上实现最多 50% 的 KV 缓存内存下降与 1.8 倍吞吐提升,在分类与推理基准上性能下降可忽略,并显著优于既有基线。

Source-provided article image: MILO: Efficient Many-shot In-Context Learning with Block-wise Low-rank Compression
Figure 1 ·

Figure 1: Top-1% Effective rank of pre-RoPE key and value over different numbers of shots on the MathQA dataset.

arXiv

深度剖析

MILO 提出块级低秩压缩策略,以块为粒度压缩 KV 缓存,每个块包含多个多示例示例。 此前的压缩思路未针对多示例上下文这一特定场景设计块粒度方案,MILO 把压缩单元与多示例示例的组织方式对齐。 文中以方法描述形式给出该策略,并说明其利用多示例上下文固有的低秩冗余;具体实现细节在所提供的摘要文本中未展开。

MILO 依据信息熵动态分配秩预算,以应对不同块之间上下文密度的异质性,保留关键块的保真度并更激进地压缩冗余块。 相比统一秩预算的做法,这种按块信息熵分配预算的机制把压缩强度与块的信息含量挂钩。 摘要给出该机制的设计动机与作用方式,未提供熵阈值、预算范围等具体参数。

在 Qwen2.5 模型上的实验显示,MILO 最多减少 50% 的 KV 缓存内存并带来 1.8 倍吞吐提升,分类与推理基准上性能下降可忽略,且显著优于既有基线。 该结果把多示例 ICL 的效率瓶颈从 KV 缓存内存转向可压缩对象,并给出内存与吞吐的量化收益。 证据来自 Qwen2.5 模型上的实验,摘要报告了内存、吞吐与基准性能三类指标;未给出具体基准名称、示例数量或基线清单。

启示与展望

该工作面向以数千条示例为条件的长上下文推理场景,尤其是 KV 缓存成为瓶颈的在线服务与端侧部署;适用对象是采用多示例 ICL 的 LLM 推理流程,验证载体为 Qwen2.5 模型。对希望降低长上下文推理内存占用、提升吞吐的工程与部署读者,这一结果提供了可参考的压缩方向:把压缩单元设为包含多个示例的块,并让秩预算随块的信息熵变化。

所提供文本为摘要级材料,未包含具体基准名称、示例数量、基线清单与消融结果,因此无法判断收益在不同任务与示例规模下的稳定性;块大小如何选择、信息熵如何计算并映射为秩预算、压缩是否影响长程依赖,均属需要进一步阅读原文确认的开放问题。

来源