跳到主要内容
返回时间线
arXiv来源发表:

MoonGS 用冻结视觉基础模型与语义排序损失,从双图前馈重建月面,LuSNAR 上 PSNR 达 23.80 dB

核心概要

MoonGS 是一个面向月面场景的前馈 3D 高斯泼溅框架:仅输入两张图像,单次前向即预测像素对齐的高斯原语,无需逐场景优化;它用冻结的视觉基础模型(DUSt3R,亦可换用 VGGT)提取鲁棒深度特征,融合语义先验并以语义排序损失正则弱纹理背景深度,再用熵引导的启发式重采样补充稀疏观测。在 LuSNAR 与自建弱纹理 MoonBlender 数据集上,其 PSNR、SSIM、LPIPS 均优于前馈 NeRF/3DGS 基线,推理保持亚秒级。

Source-provided article image: MoonGS: High-quality Representation of the Lunar Surface via Gaussian Splatting Using Robust Depth Features from Image Pairs

Ref.1

arXiv

深度剖析

提出 MoonGS,一个专为月面设计的前馈 3D 高斯泼溅框架,从一对图像直接回归像素对齐的高斯参数并渲染新视角,无需逐场景优化。 此前 3DGS 类方法需逐场景从头训练且依赖密集采集,前馈方法(pixelSplat、MVSplat)又未针对行星场景的弱重叠与弱纹理设计;MoonGS 把稀疏月面数据显式组织为图像对并配套专用架构。 在 LuSNAR 与 MoonBlender 上以 PSNR/SSIM/LPIPS 与 Du et al.、MuRF、pixelSplat、MVSplat 对比,基线均在其数据集上重训;MoonGS 在 LuSNAR 取得 23.80 dB PSNR,高于其余方法最高的 18.89 dB,推理 0.200 s、可训练参数 18.1 M。

用冻结的视觉基础模型提供跨视角深度特征,替代依赖极线约束或图像间匹配的特征提取,从而在视角重叠不足处仍能给出可靠深度。 pixelSplat 使用的 DINOv2 与深度估计无关,MVSplat 依赖 UniMatch 的双图匹配、在遮挡等情形下不够稳健;MoonGS 改用在大规模数据上预训练、生成逐视角点图的 DUSt3R 特征,并冻结其参数只训练下游模块。 冻结主干以降低可训练参数与训练成本,与低数据量下使用冻结视觉主干的既有做法一致;消融显示多尺度特征融合加 2D U-Net 精化在 LuSNAR 提升约 0.5 dB、MoonBlender 提升近 1 dB PSNR。

以两种方式引入语义:将 one-hot 语义与视觉特征拼接以改进高斯参数估计,并用语义排序损失在弱纹理背景上正则深度。 排序损失只约束区域间的远近序关系而非绝对度量深度,因此无需指定固定远平面,避免了把背景高斯不透明度置零或钳制深度所导致的远景结构丢失与尺度偏差;语义不可靠时该分支可被门控关闭。 语义融合在 LuSNAR 带来约 0.8 dB、MoonBlender 约 0.2 dB 的 PSNR 提升;排序损失以 0.01 权重在 30,000 步后微调 500 步启用,作者报告其可迁移到 pixelSplat 并改善天空区域深度。

提出熵引导的启发式重采样策略,并发布弱纹理月面数据集 MoonBlender。 重采样以泼溅后覆盖足迹的熵作为视图优先级分数,自监督地挑选信息量最大的远距离候选视角,无需真值图像;MoonBlender 用 Blender 合成 1500 张 1200×1200 图像、五条可通行路线并变化太阳方位与高度角,天空像素占比更大且纹理更弱。 在 LuSNAR 序列上,重采样取得最高 24.09 dB PSNR,优于固定间隔重采样(22.46–23.97 dB 区间);作者从 CE4 TCAM 随机抽取 96 张图像,其中 53 张含天空背景、含天空图像的平均背景像素比为 42.11%,用以说明大天空背景帧在真实数据中常见。

启示与展望

该工作面向以图像对为输入的前馈新视角合成,适用于已知相对相机位姿、可提供语义(专家标注或 SAM 类分割模型)的月面巡视场景;作者指出框架可扩展到三视角及以上,因为基础模型支持多图输入且代价体公式可推广到成对匹配,更大范围地图可由多次推理结果融合得到。每次前向的高斯原语数量等于输入像素数,因此单次显存占用取决于图像分辨率与每个原语的状态而非地形规模。对读者而言,这意味着该方法适合作为巡视器在线地形理解与视觉定位的表示层组件,并可通过替换更强的基础模型持续获益。

语义在多个模块中被使用,作者以回退机制在语义缺失或低质量时保持稳定,并计划引入边缘线索、区域性线索、不确定性感知伪标签与表面法线以降低依赖。当前网络虽推理快,但尚未轻量化到受限设备,作者提出蒸馏、剪枝与量化作为后续方向。主干在训练中保持冻结,作者计划在更大更多样数据可用时部分解冻并微调选定层。流水线假设已知相对相机位姿,无位姿变体留待未来工作。此外,MoonBlender 被作者描述为视觉与环境设置相对简单,因此其上的重建质量评估作用有限;真实数据验证为定性性质,覆盖三种光照条件。

来源