跳到主要内容
返回时间线
arXiv来源发表:

galahad-kv 在单张 H100 上实现 5000 万 token 记忆窗口:100/100 零重算恢复,比重算快 2.8–4.3 倍、省能 8.8–12.3 倍

核心概要

作者发布公开软件包 galahad-kv,把模型为每 16,000 token 块计算的 KV 状态加密写入本地 NVMe,之后按字节精确恢复而无需重算;在 5000 万 token 真实语料、单张 H100、vLLM 服务下,Gemma 4 12B 与 31B 的 100 个探测块全部零重算恢复,恢复比重算快 2.8–4.3 倍、GPU 能耗低 8.8–12.3 倍,显存全程持平,模型对植入事实的召回分别为 82/100 与 98/100 且零编造。

AI-generated editorial illustration: Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute

深度剖析

系统把每个 16,000 token 块的 KV 状态以 MRLNCRY1 格式(AES-256-GCM,每组织一密钥)写入本地 NVMe,恢复时把该块 KV 嫁接回前向传播,token 不再重算;同一时刻只有一个块驻留显存,形成 O(1) 移动窗口。 已有 KV 卸载工作(如 LMCache、CacheBlend)把状态以明文暂存并在每次请求重新装载,且部分绑定单一架构;本文的存储是加密、持久、按字节精确的,并覆盖远超窗口的内容。 在 5000 万 token 语料上,12B 与 31B 各 100 个探测块(深度 0 至 49,488,000 token)全部零重算恢复;存储审计显示 3,125 个块均带 MRLNCRY1 头、磁盘字节数与 KV 占用计算一致、块数等于存入数,无剪枝或驱逐。

复用比重算更省:恢复一个块的中位耗时 0.266 s(12B)与 0.347 s(31B),重算为 0.760 s 与 1.475 s;能耗中位 59 J 与 80 J,对比 521 J 与 976 J。 此前工作多报告延迟或吞吐收益,本文把恢复与重算在同一请求形状下直接对比,并同时给出时间与 GPU 能耗两个维度,且显示恢复时间不随深度增长。 能耗取自 GPU 的 NVML 硬件计数器并做空闲扣除;恢复 TTFT p90 为 0.284 s(12B)与 0.579 s(31B),低三分之一与高三分之一深度的 TTFT 分别为 0.193/0.274 s 与 0.343/0.375 s,表明深度无关。作者指出单次恢复约 0.3 s 接近 NVML 计数器分辨率,因此比值可靠而单次绝对焦耳带宽较宽。

答案质量由读取的模型决定而非由记忆决定:在相同存储块上,12B 精确召回 82/100,31B 为 98/100,两者均未编造块中不存在的编码,负对照 0/20 编造。 该结果把引擎属性(零重算恢复)与模型属性(文本召回)分开度量,并显示同一份持久记忆可由较便宜模型服务、由更强模型升级读取。 每次探测记录两个独立指标;答案键不进入引擎;所有未命中都是模型选了块中真实存在的错误行(同格式诱饵或块内其他数字),而非凭空生成。

作者给出抗作弊评测协议与单 GPU 复现工具链:运行时变异器替换真实来源中的姓名、日期、金额与邮箱为随机 nonce,盲式摄入(全部 5000 万 token 存完后再提问),每块植入一个高熵针并配同格式诱饵,并审计物理存储。 该协议针对预训练污染、查询前瞻、上下文丢弃、词法短路与遥测伪造五类作弊方式各设一项对策,此前的相关工作未采用这一组合。 四阶段 harness(build_hardened.py、deposit_blind.py、audit_storage.py、probe_watertight.py)为公开 HTTP 客户端(transformers、datasets、urllib),无私有组件;每个报告数字都有原始产物与 SHA-256 清单。

启示与展望

该结果面向在单张 GPU 上以 vLLM 服务的 KV 复用场景:一个块驻留显存,更深内容在请求时从磁盘恢复,因此适用于需要反复访问同一批已处理长文本、且能提供本地 NVMe 与相应磁盘容量的部署。作者指出方法可在任意单张 24 GB NVIDIA GPU 上运行,磁盘更小只是容纳更少块;12B 与 31B 的 5000 万 token 存储分别为 1.86 TB 与 6.25 TB。由于恢复时间不随深度增长,且较大模型收益更大(31B 为 4.25 倍/12.3 倍,12B 为 2.8 倍/8.8 倍),复用收益随模型规模上升。作者还提供公开 harness,第三方可替换数据集、模型与针设计,只要遵循其抗作弊协议。

作者明确说明本文不拓宽单次注意力窗口,也不做学习式检索(Blaise 被有意排除,留待未来在 5000 万规模上结合);恢复的是已处理并曾驻留显存的块。单次恢复约 0.3 s 接近 NVML 计数器分辨率,因此单次绝对焦耳数带宽较宽,而恢复与重算的比值被认为可靠。存储需在本地 NVMe,网络卷会使延迟与能耗数据失效。此外,本文不重新验证嫁接 KV 的逐字节 logit 等价性,该验证在配套的 Taliesin 工作中完成;读者若关心该性质需查阅该配套工作。

来源