跳到主要内容
返回时间线
arXiv来源发表:

LIFT 用最后一帧布局加相机轨迹控制视频生成,mIoU 从 0.41 提升到 0.51

核心概要

LIFT 提出一个统一的图生视频框架,在相机轨迹控制之外增加“未来布局”(Layout-In-FuTure)控制,让用户用最后一帧的物体布局指定新视角下应出现什么、出现在哪里;它通过双模式在线自蒸馏(OPSD)把稠密逐帧布局教师的能力迁移到仅用最后一帧布局的学生,并构建了面向大视角变化的 LIFT-Vista 数据集,实验显示其在视频质量、未来布局可控性和相机可控性上优于对比方法。

AI-generated editorial illustration: LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation

深度剖析

LIFT 把“最后一帧布局”作为显式控制信号,与相机轨迹联合条件化,使模型在大视角变化下能控制新暴露区域的内容与空间排布。 已有相机控制方法只规定视点如何移动,文本提示只给粗粒度语义,而现有视频布局方法多依赖稠密逐帧框、掩码或轨迹,且主要控制首帧已可见物体;LIFT 只需最后一帧布局即可指定未来视图的语义与构图。 论文给出统一框架与两种推理模式(仅相机轨迹的单条件模式、相机轨迹加最后一帧布局的双条件模式),并在实验中与相机控制、物体运动控制、联合控制三类基线比较。

论文提出双模式在线自蒸馏(OPSD),用稠密时空布局作为特权信息,训练一个在单条件与双条件两种模式下共享参数的学生模型。 作者报告直接用标准监督流匹配学习仅最后一帧布局效果不佳,逐步降低布局密度的 SFT 课程训练成本高而收益有限;OPSD 改为在学生的自身 rollout 状态上由稠密布局教师监督,并把监督集中在每个 rollout 的前 10 个高噪声状态。 消融显示 OPSD 仅用约 136K 样本更新(Steps×BS)即在 8 项指标中的 5 项超过使用 256K 样本更新的 SFT 基线;去掉 SFT 锚定损失后 FVD 从 99.35 升至 129.14,说明锚定项对维持生成质量有作用。

论文构建了 LIFT-Vista 数据集,专门面向大视角变化下的未来视图布局控制,包含相机轨迹与时间一致的布局标注。 现有带相机标注的视频数据集通常缺少物体级布局标签,而带框或布局的数据集往往缺少相机轨迹且只关注首帧物体;LIFT-Vista 同时提供两者,并强调相机运动揭示初始视野之外区域的片段。 数据来自 RealEstate10K、Sekai 与 SpatialVID,用 FoV 扩张比、累计平移和基于 DINOv2 的内容变化率筛选;最终得到 120,898 个 Stage 1 训练样本、58,272 个 Stage 2/3 样本和 600 个测试样本,布局标注平均每段 5.5 个物体。

在论文报告的对比中,LIFT 同时支持相机控制与未来布局控制,并在布局控制指标上取得最好结果。 与额外获得稠密逐帧框轨迹的 MagicMotion 相比,LIFT 只用最后一帧布局,mIoU 从 0.41 提升到 0.51;论文称 LIFT(1.3B)在视频质量上与 14B 的 Uni3C 和 7B 的 GEN3C 具有竞争力,并在所比较方法中取得最好的相机控制精度。 定量结果来自 FVD、FID、LPIPS、RotErr、TransErr、mIoU、SRe 与 CLIPlocal 等指标;另有 7 名参与者、每人 30 次比较、共 210 条回答的随机用户研究,LIFT 偏好率为 65.96%。

启示与展望

该工作面向图生视频中“大视角变化”这一设定:给定首帧图像、文本描述、目标相机轨迹,以及(在双条件模式下)最后一帧的物体布局,生成 81 帧、16 FPS 的视频。它适用于需要相机运动揭示初始视野之外区域、且用户关心最终帧构图的创作场景,例如从一个房间转向另一个房间并指定新出现家具的位置。论文还显示 LIFT 支持不同布局稀疏度:推理时提供更多布局帧通常改善生成质量、空间对齐与语义一致性,因此用户可以在标注成本与空间控制精细度之间取舍,同时保留仅用最后一帧的实用接口。

论文自述当前用 2D 边界框加局部文本提示表示未来视图构图,只提供粗粒度空间约束,不显式刻画深度、朝向与遮挡关系,因此更细粒度的几何或实例级控制仍是开放方向。此外,OPSD 的收益在论文中主要以与 SFT 基线的对比呈现,其在不同基座模型、不同分辨率或更长视频上的表现尚待验证;用户研究规模为 7 人、210 条回答,属于小样本偏好证据。数据筛选消融中,过滤与随机采样两组均为 30K 片段,过滤组在 FVD、FID、RotErr、TransErr 上均更好,但差距幅度有限。

来源