Draft-KV 让接收方真正用上共享方草稿的 KV 状态:MMLU-Redux 上 0.5B 接收方从 37.45% 升到 78.04%,换成无关问题的消息则回落到 36.40%
核心概要
该工作先审计了已有潜在通信接口:在五个方法-数据集组合中,把消息换成来自无关问题的消息,准确率变化最多 0.60 个百分点,即使通信本身比单独接收方高出 15.44 个百分点,说明增益可能来自接口适配而非消息内容;随后提出 Draft-KV,把共享方起草答案时形成的键值状态经线性投影放入侧记忆、由带门控的注意力分支读取,并以渐进式训练从消息重建过渡到答案监督、同时用单侧护栏限制错配消息的伤害,两个模型保持冻结、接口仅训练 1.05M 参数(比 C2C 少 348 倍);在 Qwen3-8B 共享方与冻结的 Qwen2.5-0.5B-Instruct 接收方组合下,MMLU-Redux 达到 78.04%,单独接收方为 37.45
深度剖析
论文提出并量化了“信息使用缺口”:已有潜在通信接口的准确率提升未必依赖正确配对的消息内容。 此前工作多以接收方端任务准确率提升作为通信有效的证据;该工作引入 Matched、Deranged、Receiver-only 三种条件,把系统增益拆成系统增益与配对增益两个量。 在 C2C 与 LatentMAS 共五个方法-数据集组合上做消息替换,配对增益从未超过 0.60 个百分点,而系统增益最高达 15.44 个百分点;对自行按原配方训练的 C2C 融合器,五个公开基准上 20 个逐题配对自助区间中有 13 个包含零,其余七个也都在零附近几个百分点内。
Draft-KV 把共享方“起草答案”过程中形成的键值状态作为消息,而不是静态提示缓存。 已有接口多传输共享方的提示缓存并融合进接收方缓存;Draft-KV 传输草稿位置的 KV 状态,经两个无偏置线性映射投影后作为独立侧记忆,由复用接收方冻结查询与输出投影的门控注意力分支读取,门控初始化为零。 消融显示,把草稿位置 KV 换成提示位置 KV 后,ARC-Challenge 与 MMLU-Redux 的 Matched 准确率分别下降 33.70 和 21.48 个百分点,配对增益降到 0.17 和 0.09 个百分点,即在自身架构内复现了信息使用缺口。
渐进式训练(消息重建→答案对齐→带单侧护栏的答案文本训练)让接收方真正依赖配对消息。 把可读性与使用能力分开训练,并在第三阶段用单侧铰链护栏,只在错配消息使金标答案每 token 代价超过阈值时才压低该损害。 去掉重建预训练或答案对齐都会同时降低 Matched 准确率与配对增益,且在未参与训练的 MMLU-Redux 上损失更大;去掉护栏使错配伤害上升、平均铰链约翻倍,而 Matched 准确率仅小幅下降。
Draft-KV 的增益随共享方能力增长,并可迁移到留出任务与双方各持不同证据的场景。 已有接口中更强的共享方并未稳定带来系统提升;Draft-KV 在固定接口规模下把共享方从 0.6B 扩到 8B,系统增益平均上升 32.6 个百分点(T2T 为 30.2,C2C 为 1.4)。 公开协议下 35 个设置全部优于单独接收方、30 个最优、33 个超过 T2T,平均增益 5.85 个百分点;私有协议下 14 个模型-基准设置全部超过 T2T,平均 6.41 个百分点,其中 7 个设置同时超过两个模型各自独立作答。
启示与展望
该结果面向异构模型协作场景:共享方与接收方均冻结,接口按模型对单独训练,适用于共享方能够先起草答案、且接收方需要利用该草稿的任务。公开协议下双方看到同一问题,私有协议下双方各持一半标注证据,此时消息是接收方获得另一半证据的唯一通道。论文给出的延迟与算力分解表明,Draft-KV 的额外开销主要来自对提示与草稿的一次计算密集型前向,接口本身只有 0.885 GFLOPs(MMLU-Redux)与 0.323 GFLOPs(HotpotQA),比 C2C 的 118.3 GFLOPs 小两个数量级。对希望复用更强伙伴能力的系统,这意味着可以在固定接口规模下通过提升共享方能力获得收益。
消息替换只检验跨问题错配,不涉及同一问题下草稿本身错误时的稳健性;适配器对照隔离的是依赖接收方输入的接口分量,论文也说明它并非源信息的因果分解。共享方规模扫描中 0.6B 这一点的草稿长度与能力难以分离,其草稿短且方差大。DLC 没有公开实现,论文未复现,其数字取自原论文,因此论文不对 DLC 在消息干预下的行为作断言。逐题配对区间只覆盖自行训练的四个 C2C 融合器配置,已发布检查点与 LatentMAS 仅有单点估计。此外,本次读取的文本中部分数值在正文与摘要处显示为空缺,表格中的具体数字以实验章节所列为准。
