GeoVerse 把视频生成先验注入几何潜空间,在 DL3DV 上把 PSNR 提高 2.23 dB、在 Mip-NeRF360 上把 ATE 降低 32.4%
核心概要
GeoVerse 在预训练 3D 基础模型(DA3)的几何潜空间内做扩散生成,用 ControlNet 式适配器把冻结的 Wan2.2 VACE 视频特征注入去噪器,并用持续更新的彩色点云空间记忆把历史内容重投影为目标对齐引导,从而在稀疏输入下合成跨视角一致的新视图;在 DL3DV、RealEstate10K、Mip-NeRF 360、ScanNetV2 四个基准上取得更优的视觉质量与几何一致性,其中 DL3DV 的 PSNR 比 GLD 高 2.23 dB、Mip-NeRF 360 的 ATE 比 GLD 低 32.4%,并通过 reflow 蒸馏把推理从 100 秒以上降到 10 秒以内。
深度剖析
GeoVerse 把生成过程放在冻结 DA3 编码器的多级几何潜空间里,并以 Level-1 作为合成边界,让扩散直接在具有跨视角对应关系的几何特征上运行,而不是在图像或视频潜空间里逐帧生成。 此前 GLD 已把 DA3 的几何特征空间当作多视图扩散的原生潜空间,但受限于训练分布,在真实场景上的生成保真度与稳定性不足;GeoVerse 沿用这一几何潜空间表述,并在此基础上补入视频生成先验与持久 3D 记忆。 论文给出完整的方法推导:式(1)至式(3)描述上下文与目标视图合并编码、Level-1 流匹配去噪以及 Level-0 级联采样,并说明 Level-1 被设为几何精度与视觉保真度之间的合成边界。
通过 ControlNet 式适配器把冻结 Wan2.2 VACE 的多层视频特征以加性残差注入几何去噪器,GeoVerse 用视频学到的外观先验补足几何潜空间在未见区域的结构补全能力。 与把视频扩散模型直接或顺序用于 3D 场景、从而累积跨帧不一致的做法不同,GeoVerse 只做一次视频特征提取并在几何去噪各步复用,不采样完整视频、不调用 VAE 解码器。 消融显示移除 Wan2.2 先验造成最严重的视觉退化(ScanNetV2 上 PSNR 从 19.65 降到 16.83、LPIPS 从 0.398 升到 0.463);附录 A 说明特征取自 Wan2.2-VACE-Fun-A14B 低噪声分支的 block 0、5、10、15,维度 5,120,零初始化投影保证预训练去噪器初始不被改动。
全局彩色点云空间记忆持续聚合已观测与已合成内容,并按目标相机做深度感知泼溅,输出 RGB-D 引导与有效性掩码,使多轮视图扩展锚定在同一场景表示上。 相比单次前向的一致性,连续视图扩展需要跨多次推理的持久表示;GeoVerse 借鉴 ViewCrafter 的点云记忆思路,把记忆投影作为目标侧条件编码进式(1),有效投影锚定已知结构、被掩码区域交给生成先验补全。 消融中关闭空间记忆同时降低视觉保真度与跨视角对齐(PSNR 19.65→17.87、ATE 0.009→0.014);ScanNetV2 三轮长序列评测中 PSNR 由 GLD 的 15.33 dB 提升到 19.65 dB。
对 Level-1 去噪器做分段 reflow 蒸馏,把去噪压缩到 4 步(Level-1 三步加 Level-0 级联一步),在保持质量的同时大幅降低推理延迟。 论文报告相对 GLD 超过 17 倍加速,单次推理从 100 秒以上降到 10 秒以内;蒸馏只作用于 Level-1,级联与解码头保持不变。 表 2 的步数扫描显示 Level-1 从 3 步降到 1 步时运行时间由 9.24 s 降到 6.07 s,但 LPIPS 从 0.339 恶化到 0.367;而 Level-0 级联从 49 步降到 1 步时 LPIPS 为 0.342 对 0.339,延迟显著更低,支持当前步数分配。
启示与展望
这项工作面向稀疏参考图像下的新视图合成,适用于视图插值与一定范围外推,并在 DL3DV、RealEstate10K 两个域内基准和 Mip-NeRF 360、ScanNetV2 两个域外基准上验证,其中 ScanNetV2 用于长序列评测。训练混合覆盖 15 个真实与合成多视图数据集、共 87,886 个场景与 23,760,939 张图像,采样概率与 RGB 帧数的平方根成正比,RealEstate10K 与 Waymo 使用 Pi3 估计位姿与深度。方法在 32 张 NVIDIA A800 上分两阶段训练:30 万次迭代的适配阶段与最多 5 万次迭代的 reflow 蒸馏阶段。对希望把视频生成先验引入几何潜空间、或需要多轮视图扩展且对延迟敏感的研究与工程场景,这套配方提供了可复用的组件划分:冻结几何编码器、冻结视频特征提取器、可训练适配器与持久空间记忆。
论文自述两条局限:峰值视觉保真度受 DA3 特征空间外观容量约束,以紧凑特征换取速度可能无法完全匹配全尺寸视频扩散模型的细纹理丰富度;多轮一致性同时依赖几何主干与合成 RGB 的连贯性,在无纹理或复杂区域,初始深度误差与生成外观漂移会通过空间记忆更新累积,偶尔影响长轨迹上的跨视角对齐。此外,论文提到部分基线在个别数据集上取得更低的 reprojection 或 translation 误差,说明指标表现并非在所有维度上一致领先。附录 A 指出所用 Wan2.2-VACE-Fun 检查点未公开绝对训练集规模,附录 D 说明数据清单统计描述的是可用训练池而非某次完整运行实际消费的图像数量。MoT 变体与加性残差注入的相对优势仍需在匹配训练设置下比较。
