跳到主要内容
返回时间线
arXiv来源发表:

SVEET 只训练双向视频扩散模型,就把编辑能力零样本迁移到流式骨干,单张 H100 上达到 15 FPS

核心概要

该工作提出 SVEET 框架,仅在预训练双向视频扩散模型上训练控制分支,通过时间独立的 2D 空间注意力控制分支与正交解耦训练(ODT)弥合双向与自回归特征空间差异,从而无需重训或蒸馏流式骨干即可实现高质量流式视频编辑,在单张 H100 GPU 上达到 15 FPS,并在风格迁移、视频修复与深度到视频生成三类任务上取得优于多个基线的评测结果。

AI-generated editorial illustration: Streaming Video Editing with Easy Adaptation

深度剖析

作者系统回顾现有视频到视频扩散架构,提出流式适配的两条原则:骨干特征解耦(控制机制与基座模型保持分离以保留预训练知识)与条件帧独立(源视频编码逐帧进行、不依赖跨帧关系以兼容因果推理)。 此前 DiT 类流式视频编辑基本未被探索,已有视频编辑方法依赖双向全序列处理,与流式约束冲突;该工作把“如何迁移”从工程试错提炼为两条可检验的设计原则。 作者在三种代表性架构上做对比实验:Wan-Fun 微调骨干参数、VACE 全时空注意力、VACE 时间独立 2D 注意力,观察到 Wan-Fun 迁移后严重退化、全时空 VACE 仅保留部分编辑能力且时序不稳,而 2D 注意力变体迁移明显更可靠。

SVEET 的控制分支用时间独立 2D 空间注意力替换原 VACE 分支的全时空自注意力,使每帧条件表示只依赖该帧,时序连贯性交由因果流式骨干的自回归历史建模,因此控制分支在流式推理时不需要额外的 KV 缓存。 相比保留全时空注意力的 Full-Attn 基线,这一改动让条件通路与因果分块推理兼容,同时避免在自回归骨干之外引入缓存增长开销。 消融显示 2D 注意力相比 3D 注意力改善源内容保持与流式稳定性(VLM 编辑准确度 7.1898 对 7.0653,运动平滑度 0.9830 对 0.9809),叠加 ODT 后达到最佳折中(7.4322、0.9898)。

作者提出正交解耦训练(ODT):用岭回归估计双向与因果骨干逐块隐状态之间的线性映射,对残差变换做薄 SVD 取前 k 个右奇异向量构成差异子空间,再把控制分支的可学习更新(LoRA)投影到其正交补上,并按累积谱能量逐层自适应选择秩。 该方案显式把“可控性学习”与“模型因果性”的优化方向解耦,以缓解双向与自回归特征空间不对齐导致的迁移退化,并给出特征级解耦与输出可加性的理论界。 附录 A 报告差异能量集中在少量奇异方向上,约少量方向即可解释大部分谱能量;消融中 3D 加 ODT 优于 3D 无 ODT(7.3315 对 7.0653),自适应秩优于固定秩,推理阶段投影与两阶段教师强制两种替代迁移策略表现更弱。

在风格迁移、视频修复、深度到视频生成三类任务上,SVEET 在多数指标上取得最佳平均表现,VLM 编辑准确度领先所有基线,并在单张 H100 GPU 上以 15 FPS 运行且不使用辅助加速技术。 此前实时视频编辑开源模型稀缺,且流式蒸馏据近期工作报告需约 128 H100 GPU 天并合成数千 ODE 对;该工作展示了一条无需重训流式骨干的轻量路径。 评测使用 GPT-4o 的 1–10 分 VLM 评估、CLIP-T 文本对齐与六项 VBench 指标,测试集为风格迁移 120 个视频对、修复与深度到视频各 80 个样本;另有 10 名参与者对 15 个生成视频的用户研究,SVEET 在编辑正确性 9.0800、结构保持 9.2067、整体平滑度 8.1133 上被优先选择。

启示与展望

该结果面向需要在因果流式设置下做视频编辑的场景,例如实时风格迁移与在线修复,使用者是希望复用已有双向编辑模型而不重训流式骨干的研究者与工程团队。方法默认双向骨干为 Wan2.1-1.3B-VACE、流式骨干为分块式 Causal Forcing,控制分支以秩 128 LoRA 训练、骨干参数全程冻结,训练在单张 A100 80GB 上以批大小 1 进行 10 个 epoch,视频为 81 帧、特定空间分辨率,三类任务各自训练独立控制分支。作者指出方法仍依赖底层双向编辑模型的能力,把该迁移范式扩展到更广的编辑任务与更异构的骨干被列为未来方向。

作者自述方法仍受底层双向编辑模型能力限制,更广编辑任务与更异构骨干的迁移效果尚待验证。ODT 依赖“双向到因果差异集中在紧凑子空间”的假设,附录 A 以谱能量集中作为支持,但该假设在其他骨干或数据分布下是否成立仍是开放问题。评测覆盖三类任务与有限测试集规模,用户研究为 10 名参与者、15 个视频,长期生成与更复杂编辑指令下的表现需要更多证据。此外,本文为全文阅读,但部分图表以编号引用而未在文本中展开,具体视觉细节需回到原文图表核对。

来源