4Director 用完整网格与逐帧刚体变换控制视频世界模型,在相机与物体控制上超过四个基线
核心概要
4Director 提出一种以显式 4D 场景表示为条件的视频世界模型:每个物体从输入图像一次性重建为完整规范网格,并由每帧一个刚体变换驱动,场景渲染为深度视频后经 Motion Adapter 注入预训练视频生成器以补足外观、光照与非刚体动态;作者用自动流程在 RealCOD-25K 上构建了含 20,774 个片段的 RealCOD-Rigid 数据集,并提出 Identity-Gated IoU(IG-IoU)指标,实验显示其在视觉质量、相机控制与物体控制上均优于 MotionCtrl、Perception-as-Control、SymphoMotion 与 VerseCrafter 四个基线。
深度剖析
论文提出显式 4D 场景表示:每个物体是从输入图像重建一次的完整规范网格,由每帧一个刚体变换移动,网格、背景点云与相机共享同一坐标系。 相比图像平面线索(拖拽路径、包围盒、掩码、点轨迹)在深度与旋转上的歧义,以及 3D 轨迹、3D 包围盒、提升代理(跟踪 3D 点、球体、每物体一个 3D 高斯)几何不完整的问题,该表示让位置、朝向与被揭示的表面在生成前即被固定。 论文以方法描述与对比表(含相机轨迹、3D 位置、物体朝向、完整几何、新物体插入五列)支撑,并在消融中把 2D 包围盒、3D 包围盒、3D 网格与完整刚体 3D 几何并列比较。
论文提出 Motion Adapter:一个可训练分支,把刚体场景渲染出的深度视频注入预训练视频生成器 Wan2.1-VACE-14B,由几何固定相机与物体运动,由生成器提供外观、光照与非刚体动态。 深度视频只携带视点、每个物体的刚体变换与遮挡,缺少外观、光照、非刚体动态以及图像之外的背景,适配器正是学习补足这些被省略的部分。 适配器为 3.0B 参数,在 20,774 个训练对上以流匹配目标训练三个 epoch,使用 24 块 GPU、全局批大小 24;论文另报告了 rank-16 LoRA 变体(15.3M 参数)的结果。
论文构建 RealCOD-Rigid 数据集,含 20,774 个由自动流程标注完整物体网格、逐帧刚体变换与相机轨迹的片段,并提出 Identity-Gated IoU(IG-IoU),只在物体身份得以保持的帧上累计掩码 IoU。 作者指出此前没有数据集提供片段与其刚体 3D 场景的配对,且这类标注无法大规模手工完成;同时指出单用掩码 IoU 会奖励位置正确但已不是同一物体的结果。 流程从 RealCOD-25K 的 25,318 个源片段出发,经相机与深度估计、首帧转 3D、刚体跟踪、深度渲染四阶段,通过全部阶段且不用于评估的 20,774 个片段构成训练集;IG-IoU 的身份门由 Qwen3-VL 视觉语言判定器给出,掩码来自 SAM3。
实验显示 4Director 在视觉质量、相机控制与物体控制三方面均优于四个基线,并在物体离开视野后重新进入的场景中保持同一物体。 论文报告 IG-IoU 从次优的 VerseCrafter 54.8 提升到 60.4,识别率几乎相同(94.9 对 94.8),说明提升来自放置更准确而非更常保持可识别;消融中完整刚体 3D 几何的 IG-IoU 为 60.4,去掉表面降至 50.3,去掉旋转降至 53.0。 在 RealCOD-25K 中排除训练的同一批 100 个片段上评估,使用 FID、FVD、CLIP-SIM、旋转与相对平移误差、IG-IoU 及 VBench-I2V 八个维度;另有 20 名参与者对九个案例在视觉质量、控制准确性与一致性上按 1–5 打分。
启示与展望
该表示把运动控制限定在刚体层面:关节化或形变物体整体移动,跑步、跳跃或肢体运动等更细的运动无法被指定,而由生成器决定,论文在失败案例中说明生成器甚至可能让一个以关节运动为主的物体保持首帧姿态。作者把在刚体 3D 场景中加入关节部件列为自然的下一步。方法面向从单张图像出发、由用户在 3D 查看器中编排相机与物体轨迹的场景,新物体可作为从另一张图像重建的网格插入并赋予同一坐标系中的轨迹,且无需额外训练;论文报告了 61 个编排案例,但因其没有对应源视频、训练数据也不含插入配对,仅作定性展示。
论文的定量比较集中在 100 个评估片段上,用户研究为 20 名参与者、九个案例,样本规模有限,结论的适用范围仍需在更多场景与更长片段上观察。IG-IoU 的身份门依赖视觉语言判定器,论文也指出掩码 IoU 对前后对称物体的转向不作惩罚,这类情形仅作定性展示。相机控制误差由与训练标注相同的 MegaSaM 流程重新估计轨迹得到,评估与标注共享同一估计管线。此外,刚体表示无法指定关节运动,论文的失败案例显示生成器可能让以关节运动为主的物体保持首帧姿态;把关节部件纳入场景表示后控制能力如何变化,仍是开放问题。
