RDGSplat 在冻结 3D 基础模型上解码渲染专用几何,将 WM2.0 的 RE10K PSNR 从 20.918 提升到 24.266 dB 且度量预测不变
核心概要
RDGSplat 提出一种双次评估框架:在冻结的 3D 基础模型上,通过复制预训练解码器并在纯光度监督下优化,同时用目标位姿条件适配器改写解码器读取的表示,从而解码出一套专用于渲染的几何,而模型的度量预测保持不变。在 RE10K、ACID、DL3DV 和 DTU 四个基准上,该方法在三个前馈骨干上均提升新视角合成质量,其中 WM2.0 在 RE10K 上从 20.918 提升到 24.266 dB,仅新增 205.5 M 可训练参数,且深度与位姿预测逐位一致。
Figure 2 : The two geometries of a single scene. Both are decoded from the same frozen backbone and the same context views. The metric geometry thickens the far wall into an opaque shell, and the views rendered from it lose the corridor behind it. The render-dedicated geometry resolves those surfaces into thin layers, through which the corridor is rendered.
arXiv深度剖析
RDGSplat 让一个冻结的 3D 基础模型同时服务渲染与重建:渲染分支从同一组冻结权重中解码出渲染专用几何,而预训练度量头继续输出原有的深度、位姿与点图。 此前将基础模型适配到渲染的做法(如 NoPoSplat、AnySplat)会更新骨干权重,从而放弃模型原本的度量预测,且每换一个骨干都要重做;RDGSplat 不改动任何预训练权重,度量输出按构造与预训练模型完全一致。 在 RE10K 上,WM2.0 的 PSNR 从 20.918 提升到 24.266 dB;在 KITTI 深度基准上,每个预测帧与预训练模型逐位相同,最大绝对偏差为零,位姿 AUC 在小数点后四位一致。
渲染专用几何解码(RDGD)复制预训练深度头与高斯解码器,仅用光度监督优化副本,使图元位置由渲染质量而非度量估计决定。 以往方法让同一组权重同时满足度量与渲染两个目标,或直接微调骨干;RDGD 让两套几何各走各的解码器,副本可以偏离继承的度量表面,把图元放在渲染最优的位置。 消融显示单独加入 RDGD 在 RE10K 上达到 23.485 dB、ACID 上 24.145 dB;补充材料进一步分解为高斯解码器 1.538 dB、深度头 0.882 dB、残差位姿头 0.147 dB 三步,且从随机权重训练同样三个解码器只有 17.449 dB,比冻结骨干还低 3.468 dB。
目标位姿条件适配器(TCA)在骨干残差流内部注入条件,使解码器读取的表示成为待渲染视角的函数,而非仅由上下文图像决定。 常规适配器只修改单一表示,一次前向无法同时服务两种行为;TCA 在第二次评估中按目标相机位姿改写表示,且条件不含目标图像强度,因此渲染几何仍只从上下文解码。 消融显示单独加入 TCA 在 RE10K 上达到 22.613 dB、ACID 上 23.615 dB;补充材料中,仅加入八个适配器块达到 21.520 dB,加上条件后升至 22.613 dB,说明增益主要来自条件而非块容量。
该设计在四个基准、三个前馈骨干上一致提升新视角合成,且训练成本远低于全量微调。 RDGSplat 以附加模块形式接入已有骨干,无需几何标注,也不依赖骨干原有的监督方式;相比微调同一骨干所需的全部 1.4 B 参数,它只优化 205.5 M 参数。 在 RE10K、ACID、DL3DV、DTU 上所有骨干、所有指标均提升,无任何指标回退;WM2.0 在 DL3DV 和 DTU 上分别提升 2.676 和 2.043 dB;205.5 M 参数中仅 39.0 M 从零初始化,其余 166.5 M 复制自骨干已有模块。
启示与展望
该方法面向暴露 token 流并带有冻结深度头的骨干,适用于需要在新视角合成之外保留度量深度与位姿输出的场景,例如同时消费结构与图像的 3D 任务。训练在 RE10K 上进行,零样本测试覆盖 ACID、DL3DV 与 DTU,度量几何在 KITTI 与 RE10K 上评估。渲染专用几何由渲染质量单独评分,与度量几何并存而非取代它;相机平移仍以预训练估计为锚点,只学习带惩罚的残差。推理时骨干前向两次,时延约为原来的 1.60 至 1.65 倍,峰值显存增量不超过 0.04 GB。
渲染专用几何在度量基准上作为测量略逊于预训练头:补充材料报告平移中位误差从 1.589 升至 1.609 度,10 度处 AUC 下降 0.1,20 度处不变,旋转则完全相同。深度方面无法做同样的对比,因为第二次评估的条件需要目标帧与一次初步渲染,而单序列深度基准不提供这些。两个模块的增益之和大于联合增益,说明它们部分针对同一限制,其分工边界仍值得进一步厘清。此外,训练仅使用 RE10K 训练集的随机 20% 样本,扩展到更大数据规模与更多骨干类型时的表现仍是开放问题。
