CanonicalMerge 用内容定序把多智能体 KV 缓存合并变成可收敛复制状态,在分区推理基准上追平最佳 BagMerge 排序
核心概要
该工作把多智能体潜在推理中的 KV 缓存交换建模为可收敛复制状态:CanonicalMerge 以中层平均 K 范数这一内容决定顺序固定布局,使合并缓存在任意输入排列下字节一致(合成张量 N≤5 及 Qwen3-1.7B、Qwen3-4B 真实 KV 状态上逐位验证),并在分区推理基准上无需预知最佳顺序即可追平最佳 BagMerge 排序(1.7B 全部 12 个单元内相差 4 分以内,4B 同样表现,Llama-3.1-8B 上排序差距扩大到 19 分时仍跟踪最佳排序),在 HotpotQA(n=200)与 MuSiQue 上为最佳缓存级方法。
Figure 2: Slot asymmetry measured at the mechanism level. For a fixed pair of thinker caches, both BagMerge orders are rendered and the judger’s prompt is forwarded over each merged cache; the curves show the per-token attention mass on a fragment block when the same fragment occupies the prefix slot (blue) versus the tail slot (red). Mean over 10 10 problems (two per family) and both fragments, ± 1 \pm 1 standard error (bands are narrower than the line width); Qwen3-1.7B, query-blind, 40 40 latent steps. The same bytes receive 8.5 % 8.5\% less per-token attention in the prefix slot (pooled ratio 0.915 0.915 ; the final query position alone gives 0.920 0.920 ). The tail block is closer to the judger’s positions and draws more raw attention, while the prefix block keeps its original rotation geometry ( Section 4.2 ); the net effect on accuracy is regime-dependent ( Section 5 ), which is why no fixed order wins consistently.
arXiv深度剖析
提出 CanonicalMerge,用内容决定的排序(中层平均 K 范数)固定合并布局,使合并后的缓存在任意输入排列下字节一致。 此前 Agent Primitives 的做法(作者命名为 BagMerge)将各智能体缓存拼接并做 RoPE 重编码,是非交换的,且最佳输入顺序无法先验预测,会随部署场景、潜在步预算、模型规模和模型家族变化。 在合成张量(N≤5)上验证,并在真实 Qwen3-1.7B 与 Qwen3-4B KV 状态上做到逐位一致。
把状态与布局分离:持久对象是由集合合并的内容寻址潜在片段构成的状态型 CvRDT,CanonicalMerge 是其确定性渲染。 由此每个准确率数字都可被继承,重复投递的片段会被吸收,缓存交换成为可收敛的复制状态。 以状态型 CvRDT 的集合合并语义与确定性渲染给出构造性论证,并承接前述逐位一致性验证。
在分区推理基准上,CanonicalMerge 在不知道哪个是最佳顺序的情况下追平最佳 BagMerge 排序。 说明内容定序可以替代对输入顺序的先验选择,而该顺序原本会随部署条件漂移。 1.7B 上全部 12 个单元内相差 4 分以内,4B 上表现相同;在排序差距扩大到 19 分的 Llama-3.1-8B 上仍跟踪最佳排序。
在 HotpotQA(n=200)与 MuSiQue 上,CanonicalMerge 是最佳缓存级方法。 相对直接传文本,HotpotQA 上有 7 分 F1 代价、MuSiQue 上持平;输出融合基线 PackLLM 落后 45 分。 HotpotQA 样本量为 n=200,MuSiQue 上为持平;对比对象包括传文本与 PackLLM 输出融合基线。
启示与展望
该结果面向需要把多个智能体的 KV 缓存合并进单一上下文的部署场景,尤其是输入顺序无法先验确定、且希望合并结果对排列不敏感的情形。它使缓存交换成为可收敛的复制状态:重复投递的片段被吸收,准确率数字可被继承,CanonicalMerge 作为确定性渲染无需知道哪个顺序最佳。适用性以文中验证的模型与基准为界,包括 Qwen3-1.7B、Qwen3-4B 与 Llama-3.1-8B,以及分区推理基准、HotpotQA(n=200)与 MuSiQue。
作者在 k>2 时明确界定:缓存合并传输潜在轨迹,但本身并不组合它们,因此多片段组合能力仍是开放问题。此外,逐位一致性验证覆盖合成张量 N≤5 与 Qwen3-1.7B、Qwen3-4B 的 KV 状态,其他规模与模型家族下的行为需另行确认;HotpotQA 上相对传文本仍有 7 分 F1 代价,MuSiQue 上为持平,这一差异在何种条件下稳定,文本未给出进一步说明。
