KVCMAS 用低秩锚点池与链式校正共享多智能体 KV 缓存,在 32K 共享上下文、8 QPS 下把 TTFT 相对无共享推理提速 2.0 倍,并把峰值显存降到 KVComm 的约 1/3.7
核心概要
该工作提出 KVCMAS,一个面向提示特化多智能体系统的在线 KV 缓存校正框架:它把跨智能体缓存偏差表示为紧凑的低秩状态,并沿智能体工作流链式传递校正,从而无需额外的无上下文参考预填充,在语言与视觉语言负载上取得与既有 KV 缓存共享方法相当或更高的准确率,同时在 32K 共享 token、8 QPS 下相对无共享推理获得 2.0 倍 TTFT 加速,并把峰值 GPU 显存降到先前校正方法 KVComm 的最多 1/3.7。
深度剖析
KVCMAS 观察到跨智能体的 KV 缓存偏差集中在低维特征空间,智能体特定的增量校正在各负载上的有效秩低于 32,基缓存也呈现类似结构,因此把锚点池中的基缓存与增量校正都以低秩形式存储,而注意力实际使用的活动 KV 缓存仍保持全维。 此前的在线校正方法 KVComm 需要同时保存全维基缓存与智能体特定校正,显存随共享上下文长度、锚点数和智能体数增长;KVCMAS 把锚点内存从全维降到低秩,论文给出的例子是 Llama-3.1-8B、BF16、4K token 段、若干锚点与校正时全维锚点状态约需 50 GiB。 证据来自对多个负载上增量校正有效秩的测量(论文称低于 32),以及单流执行下的显存对比:在 2K、8K、32K 共享 token 下,KVComm 的估计需求分别是 KVCMAS 的 2.5、6.2、14.9 倍;KVComm 在 8K 与 32K 共享上下文下因全维锚点池超出 GPU 显存。
KVCMAS 采用链式校正:密集预填充第一个智能体以获得精确缓存,之后每条工作流边都以已由源智能体实际产生的缓存作为参考,而不是另行构造无上下文或位置无关的参考缓存。 既有增量校正方法(GraphFlow、Kamera、KVComm)相对单独构造的无上下文参考来构造校正,对首次出现的共享上下文需要在工作流之外额外做一次预填充,且第一个智能体的近似校正误差会作为共享上下文传播到后续智能体;链式结构消除了这次参考预填充,并保留精确的首智能体缓存。 在保持其余配置不变、秩为 32、锚点数为 10 的对照中,链式校正相对非链式变体在 MMLU 上提升 6.44 个百分点(65.45 对 59.01),在 Video-MME 上提升 1.53 个百分点(52.36 对 50.83);在 32K 共享 token、8 QPS 下,链式校正把 p50 与 p90 TTFT 都降低 34%。
在五个基准上,KVCMAS 在三种基准上取得 KV 缓存共享方法中的最高准确率,在 GSM8K 与 HumanEval 上以数个百分点之差位居 KVComm 之后,同时在所有负载上给出增量校正方法中最低的端到端时延与 TTFT。 选择性重计算方法(DroidSpeak、CacheBlend、RelayCaching)只能重建被选中的缓存子集,论文附录 A.1 的测量显示各负载下至少一半的重用误差留在重计算子集之外,在 MathVista 与 Video-MME 上偏差与注意力选择只移除约 20% 的误差;GraphFlow 依赖为既往上下文关系预构造的校正,在动态请求上准确率明显下降。 准确率在三个任务智能体加一个反思智能体的框架下、每个配置运行三次取平均,KVCMAS 的准确率标准差为 0.35 至 0.86 个百分点,与其他校正方法相当;负载包括 MMLU、GSM8K、HumanEval、MathVista 与 Video-MME,样本数分别为 1,531、1,319、161、1,000 与 1,296。
在受控服务轨迹下,KVCMAS 在高并发服务中取得最低的中位 TTFT,且优势随共享上下文变长、请求率升高而扩大;在 32K 共享 token、8 QPS 下相对无共享推理获得 2.0 倍 TTFT 加速,并比次快的 GraphFlow 低 27%。 此前的增量校正方法在共享上下文增长时受制于参考预填充与全维锚点状态;KVCMAS 通过低秩锚点与链式校正同时降低这两项开销,并在智能体数与交互轮数增加时保持最低 TTFT 与最高吞吐。 并发实验在 NVIDIA A100 80 GB 上以 1 QPS 测量、TTFT 按轨迹平均,轨迹固定四智能体调度并纳入 128 token 的智能体输出;单流实验在 NVIDIA A6000 48 GB 上进行,32K 共享 token 下 KVCMAS 的 TTFT 为 3.27 秒、吞吐 4,174 token/s,优于 GraphFlow 的 3.75 秒与 3,513 token/s。
启示与展望
该结果面向在共享模型上以不同角色提示实现特化的多智能体服务,适用于顺序、循环、扇入与扇出等任意智能体转移,并覆盖文本与视觉语言两类负载;评估使用 Llama-3.1-8B-Instruct、Qwen2.5-Coder-7B-Instruct 与 LLaVA-OneVision-7B,在 NVIDIA A100 80 GB 与 A6000 48 GB 上分别测量并发与单流场景。对希望降低长上下文多智能体服务延迟与显存的工程读者,可直接借鉴低秩锚点池与链式校正这两个设计;论文也指出,使用专门迁移机制进行 KV 缓存共享的工作需要额外训练或校准,而系统级缓存优化与跨智能体缓存校正互补。
论文报告的是特定模型、特定多智能体框架与特定硬件上的结果,换用其他模型规模、其他智能体编排或不同服务栈时,低秩结构与链式校正的收益幅度仍需重新验证;可靠性阈值控制准确率与重用率的权衡,论文显示阈值升高会逐步降低准确率,因此实际部署需要在目标负载上重新选取阈值;在 Video-MME 上有一个可重用转移始终被路由到密集预填充,使重用率在约 0.65 附近饱和,说明部分转移可能长期无法从校正中获益;此外,锚点池的秩与容量消融显示秩 32 与 10 个锚点已捕获大部分收益,更大配置只带来边际提升与更高显存,这一取舍在其他负载上是否同样成立仍是开放问题。
