WhiteMatter 让 Transformer 每层都能读取任意深度的历史表示,半量 KV 缓存下困惑度优于同规模基线
核心概要
该工作提出 WhiteMatter,用可学习路由器把任意深度的历史 token 表示混合成共享的 KV 通道,使每层可读取跨层信息,并配合循环 Gauss–Seidel 迭代加速训练与预填充;在相同训练 token 预算下,半缓存 WhiteMatter 在最多约 1.3B 参数的两个规模上困惑度与下游平均分优于匹配的标准 Transformer,全缓存版本与层数更多的标准 Transformer 表现相当。
深度剖析
WhiteMatter 用内容相关的路由器为每个目标层混合任意深度的历史 token 状态,生成专门的 KV 通道,从而打破标准 Transformer 中每层只能使用同深度 KV 的限制。 此前的深到浅反馈方法(如 Feedback Transformer 把所有层状态压成一个加权和,LCKV 用最深状态构建共享 KV)都把可用来源压缩成单一层宽表示;WhiteMatter 让不同目标层获得不同的来源混合,并可通过通道共享在层间复用。 论文给出方法推导、路由器参数化与初始化细节,并通过消融支持专门混合、动态路由与深到浅反馈各自的贡献:用单一共享混合替代专门混合后表现更差,把动态路由器换成静态可学习权重会提高困惑度。
在相同训练 token 预算下,半缓存 WhiteMatter 相对匹配的标准 Transformer 降低留出困惑度,并在两个模型规模(最多约 1.3B 参数)上提高零样本下游平均分;全缓存版本在更小规模上与层数更多的标准 Transformer 表现相当。 论文报告在更小规模上,半缓存与全缓存 WhiteMatter 的平均下游得分超过包括更深标准 Transformer 在内的全部基线,且优于等缓存的 LCKV 与 FusedKV。 证据来自从零训练于 FineWeb-Edu 的 Qwen3 系列解码器,两个规模使用匹配的 token 预算与有效批量,评测使用最终检查点与完整评测划分;论文同时报告 WhiteMatter 与 LCKV 的自回归困惑度与不动点迭代结果相差很小。
循环 Gauss–Seidel 迭代把 token 位置分成若干组按序处理、组内并行,使更新能在一次全序列评估内传播更远,从而加快训练与预填充的收敛。 LCKV 使用的 Jacobi 迭代每次并行处理全部 token,但只能读取上一轮的 KV,更新只能在轮次之间前进;循环分组让后续组能读取同一次评估中更早组的更新。 在按精确自回归执行训练的参考模型上,循环迭代四轮达到目标困惑度、耗时以毫秒计,而 Jacobi 需要更多轮次,论文报告约 12.5 倍的加速;在更大模型上循环迭代同样以更少轮次达到目标。
在约 1.3B 参数规模上,WhiteMatter 的解码吞吐与标准 Transformer 相当,峰值设备内存更低,但训练与预填充的迭代开销仍高于标准 Transformer。 论文同时给出质量收益与执行代价的测量,包括解码、预填充与训练的 FLOPs 对比,以及预填充吞吐与峰值内存数据。 运行时测量在 RTX A6000 上以编译后的 BF16 执行、固定批量进行,报告多次运行的中位吞吐与峰值内存;FLOPs 用 PyTorch 在固定批量与序列长度下测量。
启示与展望
该结果面向从零训练的自回归语言模型预训练与推理:在相同训练 token 预算下,半缓存 WhiteMatter 在最多约 1.3B 参数的两个规模上改善困惑度与下游平均分,全缓存版本在更小规模上与层数更多的标准 Transformer 相当;解码吞吐与标准 Transformer 相当且峰值设备内存更低。它适用于希望在不增加层数的前提下复用历史表示、并愿意接受迭代式训练与预填充流程的研究与工程场景;论文的消融也说明专门混合、动态路由与深到浅反馈是收益来源。
论文自述迭代式训练与预填充仍比标准 Transformer 昂贵,主要质量结果覆盖到约 1.3B 参数与固定 token 预算,更大模型与更多数据下的有效性需要进一步研究,全缓存与替代 KV 共享基线只在更小规模上评测。此外,首页证据包中的外部报道与论文正文在若干数值处存在空缺(如参数量、困惑度下降幅度与吞吐比例的具体数字),因此本总结只能依据正文中明确出现的表格与文字描述;读者若需要精确数值,应回到原文核对相应表格与附录。
