跳到主要内容
返回时间线
arXiv来源发表:

PReCache 用低秩预计算与中性重建共享多 LoRA 智能体的 KV 缓存,在几乎不掉点的情况下把 TTFT 最多降低数倍

核心概要

该工作提出免训练的 KV 缓存共享框架 PReCache,包含 PreLRShared 与 ReBaseShared 两种设计:前者在共享上下文首次被处理时为所有智能体预计算紧凑的智能体专属低秩缓存,从而免除后续智能体对已处理轨迹的重复 prefill;后者进一步用无适配器的隐藏状态重建共享基础缓存以降低对上一个智能体的依赖,并给出面向单流推理的 lazy prefill 与面向并发服务的 double batching 两种调度;在 LLaMA-3.1-8B-Instruct 与 Ministral-8B-Instruct 上、HotpotQA 与 ScienceQA 两个基准中,ReBaseShared 相对无缓存共享推理的平均精度

AI-generated editorial illustration: PReCache: Efficient KV Cache Sharing for Multi-LoRA Agents via Low-Rank Precomputation and Neutral Reconstruction

深度剖析

PreLRShared 通过在每段共享上下文首次被处理时用所有智能体的下投影构造各自的低秩缓存,使后续智能体无需重新处理累积轨迹即可使用自己的 LR 缓存。 此前的 BaseShared 虽然共享基础缓存并保留智能体专属 LR 缓存,但当前智能体仍需对累积上下文做全长骨干处理来构造自己的 LR 缓存,重复 prefill 基本未被削减;PreLRShared 把这一步替换为轻量的秩 r 下投影。 论文在 LLaMA-3.1-8B-Instruct 与 Ministral-8B-Instruct 上、HotpotQA 与 ScienceQA 上评测,并给出受控轨迹下从 1.9k 到 66.4k token 的 TTFT 与吞吐数值;单流设置中 PreLRShared 在 66.4k token 时 TTFT 为 27.08 秒,而 NonShared 为 73.18 秒。

ReBaseShared 用适配器关闭时的无适配器隐藏状态重建共享基础缓存(中性基础缓存),降低共享缓存对上一个智能体适配器表示的依赖,同时保留 LR 缓存预计算。 论文观察到由无适配器隐藏状态构造的共享基础缓存比由上一个智能体适配器条件隐藏状态构造的更接近当前智能体自己的基础缓存,并给出中性基础缓存相对误差更小的推导条件,附录 A.2 在 LLaMA-3.1-8B-Instruct 与 Ministral-8B-Instruct 的 plan-to-action、action-to-reflect、reflect-to-plan 三种转移上测得逐层平均误差比大于一。 表 2 显示 ReBaseShared 在四个骨干与基准组合上整体最接近 NonShared,平均下降约 0.57 与 0.42 个百分点(LLaMA-3.1-8B 的 HotpotQA 与 ScienceQA),Ministral-8B 上为 0.62 与 2.60 个百分点;附录 B.2 报告 20 次完整评测的标准差均低于 1 个百分点。

论文为中性重建给出两种推理调度:单流推理用 lazy prefill(LP)在当前轮解码后做一次连续的无适配器 prefill,并发服务用 double batching(DB)把适配器路径与无适配器路径并入连续批处理。 两种调度产生逻辑等价的缓存状态,区别只在重建发生的时机,从而分别适配边缘单流与服务器端并发两类部署环境。 表 7 与表 8 给出数值:单流下 LP 在 66.4k token 时 TTFT 为 27.24 秒、吞吐 1068 tok/s,DB 为 49.29 秒与 889 tok/s;并发下 16 QPS 时 DB 的 p50 TTFT 为 6.83 秒、吞吐 85 tok/s,LP 为 24.79 秒与 38 tok/s。

PReCache 保持与 BaseShared 相近的显存效率,并随轨迹增长与智能体数量增加保持优势。 两种设计只存一份共享基础缓存与紧凑的每智能体 LR 缓存,避免跨智能体复制全维 KV 缓存;选择性重计算方法则要为被重算的层或 token 保留全维的智能体专属缓存。 表 9 显示在 66.4k token 时 PreLRShared 与 ReBaseShared 的峰值显存为 27.33 GB 与 27.34 GB,接近 FullShared 的 27.13 GB,低于 NonShared 的 39.47 GB;表 10 显示智能体数从 3 增至 6 时两者峰值显存仅增加约 0.5 GB,而 NonShared 增加约 8 GB。

启示与展望

该结果面向使用共享骨干加多个 LoRA 适配器的多智能体系统,尤其是长程、prefill 占主导的轨迹;默认配置把 LoRA 施加在 query 与 value 投影上(QV,秩 r),此时 key 投影无 LR 分量而完全共享,value 缓存被分解为基础缓存与 LR 缓存。单流边缘推理适合 ReBaseSharedLP,服务器端并发服务适合 ReBaseSharedDB,两者产生逻辑等价的缓存状态。论文的精度评测使用 AutoAct 的三角色框架与 HotpotQA、ScienceQA,效率评测使用受控轨迹与单张 A6000 或 A100。

摘要与正文中若干数值位置在本次载入的文本里为空缺,例如摘要中 TTFT 加速倍数、每请求吞吐提升幅度以及 ReBaseShared 的平均下降点数均未显示具体数字,正文相应处也写作“up to a TTFT speedup”“an average drop of only points”,因此这些具体幅度只能从表 5、表 6、表 9 等附录数值间接推断。此外,精度评测限于 AutoAct 的 plan-action-reflect 流程与 HotpotQA、ScienceQA,作者也说明角色结构与任务域的分析范围有限;QKVO 适配下 key 缓存变为智能体专属并引入额外的 key LR 缓存,效率趋势虽保持一致但相对 QV 有所削弱。这些都属于范围与待验证之处,而非结论的否定。

来源