EditWorld 把视频世界模型从导航推进到流式编辑:WBench-Editing 总体 73.8、编辑 80.0
核心概要
EditWorld 是一个视频世界模型,通过 Gated Causal Attention、Sparse Context、联合自回归与双向训练以及专门的数据合成与标注流程,在自回归生成过程中接受流式编辑指令与参考图像,并配套提出约 150 个案例、每例 240–480 帧的 WBench-Editing 基准,在该基准上取得总体 73.8、编辑 80.0 的最佳成绩。
深度剖析
EditWorld 把世界模型的交互从导航扩展到对已有世界内容的精确修改,支持在自回归生成过程中持续接收流式编辑指令,并灵活注入参考图像内容。 论文指出,已有视频世界模型主要聚焦导航与文本驱动事件生成,XGEN-JING 与 ABot-World 等虽支持初始参考的身份条件,但无法让用户在交互过程中灵活地把不同参考图像的内容注入生成世界;EditWorld 将编辑与参考条件都做成随时间变化的流式条件。 摘要与引言给出能力定位,方法部分给出 Gated Causal Attention 与参考图像 token 单向门控自注意力的具体设计,属于系统与架构层面的证据。
为支撑流式编辑,EditWorld 引入 Gated Causal Attention 处理随时间变化的编辑条件与参考图像,并用 Sparse Context 把历史上下文限制在固定预算内以支持长时程推理。 论文说明编辑指令提示仅在对应 chunk 被标注为 during 时激活,且每个 chunk 还会关注前两个 chunk 的提示以缓解提示切换带来的突变;参考图像 token 只能关注同一参考图像内部,视频 chunk 能否看到参考图像由其文本上下文门控,并给参考 token 分配负的时间 RoPE 偏移以抑制直接复制粘贴。 方法章节给出注意力可见性规则、门控条件与 RoPE 处理,并配有消融:去掉单向自注意力会丢失参考细节,去掉短期文本上下文会在编辑提示切换处出现明显场景跳变。
训练上采用联合自回归与双向目标、退火自重采样以及两阶段少步蒸馏,使模型在获得因果生成能力的同时保持对输入条件的响应能力。 论文报告仅优化因果目标会使模型偏向视频续写、削弱对多样输入条件的响应,因此按 LingBot-World 2.0 的做法联合优化两个分支;消融显示联合 AR+BI 把 Editing Overall 从 69.7 提升到 80.0,Detail Accuracy 从 34.9 提升到 53.2。 消融表给出 AR Only 与 AR+BI 在 Editing Overall、Editing Presence、Semantic Alignment、Editing Completion、Detail Accuracy、Edit Cleanliness 上的对照数值。
论文构建了面向世界编辑的数据合成与标注流程,并提出 WBench-Editing 来系统评测流式世界编辑能力,EditWorld 在该基准上取得最佳总体成绩。 数据侧区分全局编辑与局部编辑分别设计合成流程,标注包含场景描述、编辑指令、编辑状态与相机位姿,并用 ViPE 重估相机内外参;评测侧在 WBench 框架上重设计约 150 个案例,每例 240–480 帧、含一到三条编辑指令,部分含参考图像。 论文报告 EditWorld 在 WBench-Editing 上总体 73.8、编辑 80.0,比第二名 YUME 1.5 的总体 67.0 高 6.8 分,编辑指标比第二名 54.8 高 25.2 分;在含参考图像子集上总体 74.0、编辑 74.6。
启示与展望
这项工作面向需要在生成世界中持续修改内容的交互场景,例如多轮编辑、按回合注入参考图像以及长时程自回归生成;论文说明其数据流程区分全局编辑与局部编辑,评测在 WBench-Editing 的约 150 个案例上进行,每例 240–480 帧、含一到三条编辑指令,部分含参考图像。对希望在此基础上继续推进的研究者,论文提供的可复用部分包括 Gated Causal Attention、Sparse Context、联合自回归与双向训练、退火自重采样、两阶段少步蒸馏,以及 WBench-Editing 这一评测入口。
论文报告的是 WBench-Editing 与 WBench 上的评测结果,编辑相关指标通过 VLM 问答评估;不同基座、不同数据条件或不同交互轮次下的表现仍需更多独立验证。数据流程依赖多套现成模型进行合成与标注,其标注质量对最终能力的影响在文中未单独量化。此外,参考图像条件在对比中因多数已有模型不支持交互式参考输入而统一采用纯文本流式编辑指令,参考条件下的横向可比性仍有进一步观察空间。
