跳到主要内容
返回时间线
arXiv来源发表:

FlashForward 复用飞行中 KV 缓存并加稀疏干净锚点,在四 GPU 上把 20 秒以上视频生成提速 1.16–1.69 倍且 VBench 总分达 0.838

核心概要

FlashForward 把自回归视频扩散中每个普通去噪前向已经算出的“飞行中”KV 缓存直接发布给后续分块复用,并用提前生成的稀疏干净锚点 KV 提供长程结构引导,从而省去仅用于更新缓存的额外前向;在最多四块 GPU 上,对 16 FPS、20 秒以上的 1.3B 与 14B 模型在 480p 和 720p 下比 HiAR 快 1.16–1.69 倍、比 Self-Forcing 快 1.42–2.92 倍,1.3B 模型 480p 的 VBench-1.0 总分为 0.838,并在 20s、35s、65s 时长上保持稳定。

AI-generated editorial illustration: In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion

深度剖析

论文把跨分块记忆重新表述为“状态可用性”问题:跨分块状态契约规定每个分块发布什么表示、处于什么噪声水平、以及后续分块何时可以消费它,并据此提出 FlashForward,让每个普通渲染前向在推进当前分块输出的同时,把同阶段的 KV 发布给后续分块。 此前 Self-Forcing 需要在一个分块完成后额外做一次仅更新缓存的前向来构造干净 KV,HiAR 则在每个去噪阶段重新编码被消费的前驱分块;FlashForward 是论文表 1 中唯一“由推进输出的前向产生、且能提前用于跨阶段流水线”的记忆。 论文给出形式化定义与表 1 的机制对比,并在 1.3B 与 14B、480p 与 720p、最多四 GPU 的设置下测量延迟,报告 20 秒以上比 HiAR 快 1.16–1.69 倍、比 Self-Forcing 快 1.42–2.92 倍。

由于同阶段历史来自未完成的含噪分块,单独使用会造成外观与运动漂移,论文用提前生成的稀疏干净锚点潜变量构造干净锚点 KV,形成两侧条件:稀疏干净锚点 KV 提供粗粒度、长程的两侧结构引导,稠密同阶段历史保留近期细粒度演化。 论文把稀疏规划加两侧条件这一既有思路重新用作粗时间尺度状态,与细时间尺度的同阶段渲染历史互补;消融显示只用同阶段历史时视频闪烁严重到 VBench 无法给时间闪烁维度打分,只用干净历史与未来则退化为高延迟的 Self-Forcing 变体,两者结合得到 0.838 的总分。 表 3 底部在相同训练设置下比较三种条件模块,最终设计在 Total 0.838、Quality 0.859、Semantic 0.753 上均高于两个单模块变体。

论文用共享生成器骨干加角色嵌入与角色专属 LoRA 实现规划器与渲染器两个角色,并分两阶段训练:打包的监督微调从真实视频建立规划器–渲染器图,自回滚蒸馏把引导与去噪阶段蒸馏到少步生成并适配生成上下文。 监督阶段直接学习真实视频而非教师轨迹,因此可用任意长度片段,论文使用 20 秒片段(含九个锚点、恰好三个锚点块)以显式训练规划器的自回归依赖;蒸馏阶段则用全片段自回滚加分布匹配目标缓解暴露偏差。 表 3 顶部消融显示时间重基监督为蒸馏提供更好初始化,角色专属嵌入与 LoRA 在蒸馏阶段把总分从 0.8184 提升到 0.8380,并减少锚点与非锚点位置之间的接缝。

论文报告渲染器重新生成锚点位置而非把规划器锚点直接拼进最终视频,因为拼接方案会在锚点处产生周期性接缝;把规划器锚点仅用作条件、由渲染器生成全部输出位置可显著降低接缝。 论文用面板 (a)(b)(c) 分离锚点 KV 来源与最终锚点来源的影响,并显示即使把生成的规划器锚点换成真实视频编码的锚点,接缝仍然存在,说明这是输出接口不匹配而非单纯的规划器生成误差。 50 步下把最终锚点从规划器改为渲染器,锚点接缝从 3.93 降到 1.83、周期性总量从 7.66 降到 3.54;四步部署下锚点接缝从 6.20 降到 2.43、周期性总量从 9.55 降到 5.61。

启示与展望

论文面向多 GPU 上的长序列少步生成:在最多四块 GPU、16 FPS、20 秒以上、1.3B 与 14B 骨干、480p 与 720p 的设置下,FlashForward 是所评测的最快自回归调度,并在 1.3B 480p 上于 20s、35s、65s 保持稳定质量。它自然支持流式生成:把一块 GPU 专用于规划器、其余 GPU 用于四阶段渲染波前,渲染可在第一个锚点块发布后立即开始,五 GPU 配置下 1.3B 在 20–65 秒进一步提速,14B 跨两个 GB300 节点时大部分锚点生成被隐藏在渲染之后。论文还给出前向计数模型与两条盈亏平衡条件,用于判断何时前向数减少会转化为实际墙钟加速,并指出小前向场景下应把规划器放在单 rank 而非使用上下文并行。

论文的 14B 行是仅系统的计时测量,用相同张量形状、掩码、缓存路径与执行调度实例化 14B 骨干,因此其质量结论主要来自 1.3B 480p 的 VBench 评测。质量对比中竞争方法的结果取自 HiAR,VBench-Long 则由论文在统一协议下自行运行四种方法。论文使用固定锚点步长、条件窗口与除时间重基增强外的常规训练配方,并指出放宽当前干净锚点状态假设、自适应锚点选择、与 KV 选择压缩、RoPE 修改及抗漂移技术结合、以及锚点界定区间的并行生成都留待未来工作。此外,训练数据仅真实视频,可能使模型偏向写实内容,在动画等风格化领域的表现仍是开放问题。

来源