跳到主要内容
返回时间线
arXiv来源发表:

WorldCrafter:一致视频世界模型与隐式三维感知记忆

核心概要

该工作提出 WorldCrafter,一个相机可控的自回归视频世界模型:它学习可被相机位姿查询的隐式三维感知记忆,把历史潜帧压缩成固定 token 预算的记忆标记,在去噪前注入视频扩散 Transformer,使单张图像或文本提示即可驱动分钟级的流式场景探索,并在静态与动态场景的重访一致性和相机控制准确度上优于所评估的基线,同时保留视觉质量。

AI-generated editorial illustration: WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

深度剖析

WorldCrafter 用记忆编码器把累积的历史潜帧及其相机参数写入紧凑的隐式三维感知表示,再由位姿条件读出模块输出固定数量的记忆标记,在去噪前直接经自注意力条件化视频 DiT;论文强调这一路径“without explicit depth-based correspondences”,即不依赖显式深度对应,也不重建目标视角图像。 相对于把检索到的历史帧或注意力缓存当作上下文记忆的做法,以及依赖深度估计与几何变形构建显式空间记忆的做法,这里让“请求的视角”决定多视图证据如何被压进生成器有限的 token 预算,并用冻结/联合训练对照来检验记忆与生成器共同适配的价值。 消融表给出同一训练与推理设置下的对照:上下文记忆变体 MEt3R 0.382、LPIPS 0.497,冻结记忆编码器变体 0.227 与 0.305,完整模型为 0.166 与 0.255;效率上记忆编码 0.049 秒加读出 0.013 秒合计每块 0.062 秒,而基于深度的空间记忆为深度估计与对齐 0.409 秒加批量变形 0.937 秒合计每块 1.346 秒。

记忆读出采用位姿引导方式:用从即将到来的目标相机轨迹采样的固定数量查询位姿去查询记忆表示;历史输入则保留最新潜帧,并贪心选择联合视场覆盖目标区域的互补帧。 消融把位姿引导读出与位姿无关读出对比(后者 MEt3R 0.251、LPIPS 0.333),又把最大覆盖度检索与按成对 FoV 相似度排序的检索对比(后者 0.213、0.296),显示两种设计在相同 token 预算与相同历史帧数量下同时改善重访一致性与相机控制。 两组消融均给出记忆指标与相机指标(RotErr、TransErr、CamMC)的成对数值,覆盖读出一侧与检索一侧的设计选择。

在作者整理的基准上,WorldCrafter 及其蒸馏版本在记忆四项指标上均列前二、相机三项误差最低,VBench 八项中五项最佳;论文自述重访一致性相对最强基线提升 47.6%。 基准含 145 张图像(83 个动态物体中心场景、62 个静态场景),每张配 5 条度量相机轨迹,共 725 段视频/方法,轨迹跨度 528–1,648 帧并包含闭环重访;对照为 8 个近期相机可控世界模型,例如 Lyra 2.0 的 LPIPS 0.487、PSNR 14.050 dB。 多指标(MEt3R、LPIPS、PSNR、SSIM;RotErr、TransErr、CamMC;VBench 八维)与多基线,且所有方法使用相同初始图像、文本与目标轨迹并在统一分辨率下评估;WorldCrafter-fast 取得 MEt3R 0.129、LPIPS 0.186、PSNR 20.868 dB、SSIM 0.616,WorldCrafter 的 RotErr 13.536、TransErr 1.475、CamMC 1.546,VBench 总分 81.910。

在少步蒸馏下,模型被做成可实时交互的流式系统:采用由粗到细的金字塔去噪与分布匹配蒸馏,3 个空间分辨率、每个 2 步;并分别蒸馏低噪声模型与高噪声模型,以兼顾自然外观与合成数据带来的主体跟随能力。 相机条件在金字塔各层之间通过重标定空间坐标、保持相机位姿与视场不变来维持,使少步蒸馏后仍保留相机控制;WorldCrafter-fast 报告在 4 GPU 机器上 16 fps 的生成速度。 给出四阶段训练流程、数据组成(OSP、DL3DV、MIND 合成视频)与蒸馏配置,并报告速度;VBench 中 WorldCrafter-fast 取得最佳 TF(96.444),总体 80.285。

启示与展望

这项工作面向需要用户指定相机轨迹、并要求长时间返回旧视角仍保持一致的交互式视频世界模型:输入可以是单张图像或文本提示,输出是可流式生成的场景探索视频,实验覆盖静态场景与动态物体中心场景,基准中的轨迹包含闭环重访,长度为 528–1,648 帧,蒸馏版本报告在 4 GPU 上达到 16 fps。因此它对该领域的研究者与系统实现者最有用,尤其是关心在固定 token 预算下如何写入与读出历史证据的人。论文本身也给出下一步方向:用自回归流式记忆编码器增量吸收每个新生成的块,以减少对历史的重复计算;记忆效率对比说明,绕开深度估计与变形直接把记忆处理成本压到 0.062 秒每块的路线,是这类系统继续扩展的可行起点。

读者仍会关注几处边界:论文自述一致性在“particularly complex or extended trajectories”上仍可能断裂,并且“re-encoding history at every chunk incurs extra latency”,这使得更复杂轨迹与更长时限下的表现仍是开放问题。效率对比中,记忆处理成本相对基于深度的空间记忆降低的倍数在载入文本里写作“by a factor of ,”,具体数值并未给出,只有 1.346 秒与 0.062 秒两个分项可供比较。论文的领先幅度是相对所评估基线与自建基准而言,换到其他轨迹分布或场景领域后是否保持,需要外部复现来回答。另外,本次载入的证据包中,外部报道是 Hugging Face 论文页面的模型列表式条目(列出 TencentARC/WorldCrafter-Fast,Image-to-Video,更新于约 24 小时前,7),没有独立采写的额外事实;栏目判断因此完全建立在论文全文之上,而论文中的 Figure 2 管线图与 Figure 5、7、9 的定性对比与曲线细节在载入文本中只被引用、未以图像呈现。

来源