跳到主要内容
返回时间线
arXiv来源发表:

把几何写进生成状态:GAE 用几何原生潜空间统一感知与生成

核心概要

该工作提出几何原生自编码器(GAE),把冻结的几何基础模型 DA3 的四层特征压缩为 64 或 128 通道的单一紧凑潜变量,使其可同时解码为 RGB、深度、相机与点图,并在固定生成器与训练协议的受控比较中,相对最强的非 GAE 潜变量在 RealEstate10K 与 DL3DV 上降低 FVD、在 RealEstate10K 上把相机轨迹误差约减半。

AI-generated editorial illustration: GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

深度剖析

提出 GAE:在冻结的 DA3 编码器与冻结的几何头之间放置学习到的瓶颈,把四层特征层级融合并压缩为单一潜变量,再一次性重建整个层级,使同一潜变量既被冻结几何头读为深度、相机射线与点图,又由学习到的 RGB 头解码外观。 以往做法要么把几何作为附加输出、控制信号或后训练目标加在以外观为主导的潜变量上,要么直接对几何基础模型的高维特征层级做生成(如 GLD 的级联、潜黎曼流匹配在产品流形上联合演化四层);GAE 改为学习整个层级的一个紧凑欧氏重参数化,用单一流模型演化。 方法层面给出两阶段训练(先训练编解码器、再冻结并训练条件流模型)与公式化目标;受控比较中 GAE-128 以 24 倍更少的通道在 PSNR、LPIPS、rFID、rFVD 上匹配或略超原始 L0 特征。

论证潜空间的组织方式与重建内容同等重要:仅做重建的编解码器虽然紧凑且条件良好,但传输平滑性与语义邻域仍弱;加入对 C-RADIO 的逐 token 对齐可改善传输平滑度与语义邻域一致性,却会明显削弱成对空间结构,再以 DINOv2 的成对相似度匹配恢复关系几何。 把表示对齐从去噪器中间表示(如 REPA)前移到编解码器潜变量本身,并指出逐点对齐会破坏关系结构、需要关系型目标补足。 表 1 给出三步递进的表示诊断(传输模糊度、条件数、有效秩、LNC@5、LDS、SRSS、xLNC),表 8 显示该潜变量质量提升可迁移到下游生成的外观、跨视图几何与相机恢复。

在固定流模型、训练预算与相机条件机制的受控比较中,GAE 潜变量同时改善外观质量与独立测量的三维一致性:GAE-64 在两个数据集上取得最佳整体结果,相对最佳非 GAE 受控潜变量在 RealEstate10K 与 DL3DV 上降低 FVD,并在 RealEstate10K 上把 ATE 大幅降低。 此前的外观主导潜变量、语义表示自编码器与原始几何特征各有短板(像素 VAE 条件好但结构弱,语义 RAEV2 语义邻域强但无原生几何读出,原始 DA3 特征几何原生但高维且条件差);GAE 在几何原生表示中给出传输、条件与结构的最佳整体平衡。 受控设置使用共享的 64 个场景留出池、每场景九视图、一个参考视图、50 步欧拉采样与固定 CFG;相机指标由与所有被评潜变量无关的 VGGT 独立重建,DA3-GIANT 仅作骨干重叠的交叉核对。

同一条件流模型通过条件 dropout 支持文生图、相机控制视频与参考条件新视角合成,并展示 81 视图长序列 rollout 与文本条件生成;参考视图以干净条件 token 形式置于 ODE 状态之外,避免集合编码带来的训练—推理不匹配。 把参考证据与噪声状态分离,使条件与无条件采样共用同一 ODE 参数化,无需在采样中反复钳制参考槽位;度量 Plücker 射线条件保留逐场景归一化所丢弃的平移尺度。 消融显示干净条件 token 相对把参考潜变量放入 ODE 状态降低 FVD 并缩小参考—目标点云差距,度量位姿相对逐场景归一化位姿显著改善尺度敏感的相机恢复,文生图协同训练在不牺牲 MEt3R 的前提下改善 FVD 与 LPIPS。

启示与展望

该结果面向以几何一致性为目标的视觉生成与三维感知场景,适用于需要相机可控、跨视图一致的世界模型式生成任务;受控结论建立在 RealEstate10K 与 DL3DV 的共享留出池与固定流模型协议上,更大规模、更高分辨率与更长序列的结果为定性展示,不属于受控比较。

摘要与正文中若干数值在证据包内以占位形式出现(如 FVD 下降幅度、条件数范围),因此具体数值需回到原文表格核对;此外,几何监督使用冻结 DA3 头对原始特征产生的伪目标而非数据集深度标签,长序列与文本条件结果目前为定性能力检查,尚不清楚在其他数据域、更长序列或不同几何骨干下的表现。

来源