WorldAttention 用分层 KV 缓存与混合稀疏注意力把交互式视频世界模型推到单卡 H100 上 22 FPS,并在 VBench-Long 取得 0.9472 主体一致性
核心概要
该工作提出 WorldAttention,一种面向交互式视频世界模型的注意力架构,通过分层 KV 缓存(HKV)在 GPU、CPU、NVMe 多级内存间做页面级存储与两阶段检索,并用混合稀疏注意力(HSA)结合线性全局分支与头自适应块稀疏分支,在 VBench-Long 与 InterVBench 上取得主体一致性 0.9472 与 0.9668,同时实现相对 FlashAttention-3 的 14.02 倍稀疏核加速、整体 2.21 倍端到端加速,并在单张 NVIDIA H100 上维持 22.0 FPS。
深度剖析
WorldAttention 在 VBench-Long 与 InterVBench 上取得领先的生成质量,主体一致性分别为 0.9472 与 0.9668,背景一致性 0.9691 与 0.9614,运动平滑度 0.9915 与 0.9972。 此前交互式长视频生成方法在滑动窗口缓存与全历史缓存之间取舍:滑动窗口丢弃早期视觉上下文,稀疏检索缓存则面临 KV 缓存随长度线性增长的压力;该工作把注意力结构与 KV 管理联合设计,在保留全历史的同时提升一致性指标。 在 VBench-Long 上按 LongLive 的 160 条 60 秒交互提示(每条含六个连续 10 秒提示)评测,并在 InterVBench 的 200 条 50 秒以上视频上报告五类 VDE 漂移指标与五项 VBench 指标;表 1、表 2、表 12 给出与 MAGI-1、Self Forcing、SkyReels-V2、LongLive、BIFE 等基线的逐项对比。
分层 KV 缓存(HKV)把历史 KV 对按每页 8 帧切分为语义页,在 L0 GPU SRAM、L1 GPU HBM、L2 CPU DRAM、L3 NVMe 之间分层存放,并用提示级与页面级两阶段检索选出 top-Kp 页构成活跃缓存。 既有方案要么在块级粒度做检索、加载整块造成冗余,要么只保留最近窗口;HKV 把检索粒度细化到页面级,并让未被选中的页自动下沉到更低成本内存,使 GPU 占用不随视频长度增长。 表 5 显示 HKV(Psize = 8, Kp = 4)取得 85.53 质量分与 22.0 FPS,优于滑动窗口的 82.52 与重缓存 32 帧的 84.82(后者仅 7.10 FPS);表 6 在同样四页活跃预算下对比页面级、提示级、块级、最近页、随机页与错配页检索,HKV 在 50–60 秒片段的 CLIP 分数为 25.01,高于 21.48、20.12 与 17.36。
混合稀疏注意力(HSA)把线性全局分支与头自适应块稀疏分支通过门控融合,线性分支用 Linformer 式低秩投影把复杂度从 O(L²) 降到 O(Lr),稀疏分支按每个注意力头的累积注意力质量阈值 τh 选择最少的块。 以往稀疏或线性注意力多面向推理加速,未针对分块式长时程视频生成做适配,也未与 KV 管理和硬件核协同设计;HSA 让不同头按自身注意力分布自适应决定稀疏度,并区分块间(Binter = 128)与块内(Bintra = 64)粒度。 表 4 的消融显示仅线性分支主体一致性 0.9021、仅稀疏分支在 τmax = 1.00、τmin = 0.35 时为 0.9365,两者结合达到 0.9472;图 6 显示该线性分支在全局注意力质量分布与输出余弦相似度上比 SLA 与 SANA-Video 的线性注意力更接近全注意力基线。
面向硬件的核定制把 HSA 的理论效率转化为实际吞吐:稀疏注意力核相对 FlashAttention-3 峰值加速 14.02 倍,与 HKV 合计带来 2.21 倍端到端加速,并在 B200、14B 模型、720p、90 秒等设置下保持增益。 该工作指出稀疏块注意力核本身只占总延迟的 1.86%,KV 缓存重排与连续内存拷贝等预处理才是主要开销,因此把核优化与 KV 管理作为整体系统来设计,而非只优化单个注意力核。 表 9 给出逐步叠加的端到端加速:基线 1.00×、加 HKV 1.15×、加 HSA 1.91×、加核定制 2.21×;表 10 给出 HSA 执行时间分解;表 11 在 H100 与 B200、1.3B 与 14B、480p 与 720p、60 秒与 90 秒上报告 2.06× 至 2.46× 的加速。
启示与展望
该结果面向文本条件驱动的交互式视频世界模型,适用于分块式自回归扩散框架下的分钟级长视频生成,评测建立在 VBench-Long(按 LongLive 的 160 条 60 秒交互提示)与 InterVBench(200 条 50 秒以上视频)之上,效率结论覆盖 H100 与 B200、1.3B 与 14B、480p 与 720p、60 秒与 90 秒等配置。作者在局限与未来工作中说明,当前框架主要以文本提示作为控制信号,尚未纳入动作信号、控制轨迹或具身交互线索;若扩展到动作条件化生成,模型可进一步承担可控环境仿真与决策驱动视频预测的角色。对读者而言,这意味着该架构的价值首先体现在需要长程记忆与低延迟的交互式生成场景,而非通用视频生成的全部任务。
仍待观察的问题包括:两阶段检索在真正多事件提示下的表现,作者指出 Top-k 块检索对多事件提示可能更稳健,但在当前评测设置下检索更多块会稀释固定的页面预算,因此采用了 Top-1;页面大小与检索页数的组合(Psize、Kp)在更长时程或更高分辨率下的最优取值;以及当控制信号从文本扩展到动作或轨迹时,HKV 与 HSA 的设计是否仍然成立。此外,本总结基于论文全文与首页证据包,未包含代码仓库与项目网站中的实现细节,因此复现层面的具体配置仍需查阅原文与附录。
