VGGT-Diff 把 VGGT-Ω 几何潜变量路由进 Wan 视频扩散,在 6188 个 DL3DV 目标上取得 PSNR、LPIPS、DreamSim 三项第一
核心概要
VGGT-Diff 提出一种几何路由的多视角扩散框架,用冻结的 VGGT-Ω 把源视角特征连同 3D 点与置信度经置信度感知的 Visual Geometry Router 变换为与查询视角对齐的条件,注入预训练 Wan2.1-I2V-14B 视频扩散模型,并用 Point-Track Residual Consistency 沿可靠 3D 点轨迹对齐各视角的预测干净残差;在仅 980 个 DL3DV 训练场景下,于 6188 个 DL3DV-Benchmark 目标上 PSNR、LPIPS、DreamSim 排名第一、SSIM 第二,零样本 Mip-NeRF 360 上 LPIPS 与 DreamSim 第一、PSNR 第二。
深度剖析
论文提出几何路由的生成框架:冻结的 VGGT-Ω 为每个源特征关联 3D 点与置信度,Visual Geometry Router 通过深度选择的硬锚点(hard z-buffer 按归一化置信度加权平均)建立源到查询的对应,再以置信度加权的前表面与次级假设作为残差线索,经零初始化残差精炼器修正遮挡边界与投影误差附近的位置。 此前生成式 NVS 的源到查询对应多为隐式,重建式方法又难以补全未观测区域;该工作把几何基础模型的视觉 token、3D 位置与置信度显式转成查询对齐的扩散条件,而不是把重建几何当作完整场景表示或预渲染 RGB。 消融显示移除全部 VGGT-Ω 相关组件时 PSNR 下降最多、LPIPS 上升最多;把路由特征换成点渲染 RGB 会损失 PSNR 并抬高 LPIPS,说明带外观的特征比不完整 RGB 渲染提供更丰富证据;去掉分层残差精炼仅带来较小下降,说明硬路由已承担主要收益。
论文提出 Point-Track Residual Consistency(PTRC),复用 VGGT-Ω 的点预测在每对查询视角间建立轨迹,仅保留在两视角内投影、位于两相机前方并通过逐视角 z-buffer 可见性测试的点,用置信度加权的 Smooth-L1 对齐各视角的预测干净残差而非原始速度或 VAE 潜变量。 逐视角流匹配损失不约束剩余误差的跨视角几何一致性;直接匹配 RGB、潜变量或速度会压制视角相关的光照与可见性差异。PTRC 只耦合应当被消除的误差,从而在保留合法外观变化的同时抑制跨视角漂移。 在 192 个姿态分层目标上,PTRC 相对直接对速度施加同样点轨迹、置信度与鲁棒惩罚的对照,PSNR 与 SSIM 提升、LPIPS 下降,且在全部六个姿态分箱上一致改善;去掉 PTRC 是单组件消融中 SSIM 损失最大的一项。
论文引入几何条件正则化与推理期 Geometry-Prior CFG:训练时对路由几何条件随机保留、衰减或移除(源外观与 Plücker 射线不变),推理时用仅置零查询槽稠密几何的参考分支在前 20% 去噪步内平滑衰减地增强几何先验。 稀疏观测恢复的几何必然不完美,若被当作无误重建会导致过度依赖;该工作把几何当作带不确定性的证据,并让同一套 dropout 机制在推理期提供匹配的引导分支。 去掉条件正则化带来 PSNR 与 SSIM 下降、LPIPS 上升;在同一检查点上施加 Geometry-Prior CFG 进一步提升 PSNR 与 SSIM 并降低 LPIPS,作者据此判断正则化是主要机制、CFG 是无需重训的互补增益。
论文报告了跨数据集与跨姿态难度的评测结果,并用两个冻结重建器检验跨视角一致性。 单目标指标无法判断联合生成的视角是否支持同一场景,因此作者用训练与条件中均未使用的 Pi3 作为独立重建器,与 VGGT-Ω 主探针交叉验证。 在 6188 个 DL3DV 目标上 PSNR、LPIPS、DreamSim 第一、SSIM 第二,且仅用 1K 场景训练;相对同用 Wan2.1-I2V-14B 的 FrameCrafter 取得 PSNR 与 SSIM 增益;192 个姿态分层目标中五个分箱领先、插值-近距仅落后 SEVA;52 个场景八视角重建中两个重建器下均排名第一,Chamfer-L1 与 F-score 相对 FrameCrafter 改善,作者注明这些指标衡量相对一致性与可重建性而非绝对 3D 精度。
启示与展望
该结果面向有相机位姿的稀疏源视角到指定查询相机的静态场景新视角合成,训练使用 DL3DV-10K 的 1K 场景划分(去掉 1 个不可用场景与 19 个与 140 场景基准重叠的场景后为 980 个),评测覆盖 DL3DV-Benchmark 的 6188 个目标与零样本 Mip-NeRF 360。方法冻结 VAE 与 VGGT-Ω,只微调 Wan DiT、扩展输入投影、视觉特征适配器与 Visual Geometry Router,因此可直接复用现有视频扩散先验;作者指出几何路由与残差一致性可扩展到更多视角、更长相机轨迹与动态非刚性内容,并给出多层级特征融合、参数高效适配与更丰富可见性建模等方向。跨视角一致性指标以目标 RGB 重建结果为参照,用于相对比较而非绝对 3D 精度。
正文为快速解析版本,图 2、图 4、图 5、图 6、图 7、图 8、图 10 与表 2、表 4、表 5、表 6、表 7、表 8、表 9、表 10、表 12、表 13 的具体数值未在文本中完整呈现,因此部分增益幅度只能以文字描述为准。作者提到 42K、60K、88K 检查点存在局部回退、100K 时 PSNR 增益收窄,优化是否接近饱和仍是开放问题;VGGT-Ω 特征深度上中间层表现更好、联合优化反而下降,作者将其归因于流匹配梯度改变预训练表示,这一解释尚待进一步验证;跨视角一致性以重建结果为参照,绝对 3D 精度未被评估;三视角与四视角输入下的鲁棒性来自六视角训练的检查点,未做适配。
