arXiv 2026年10月5日作者提出SNAP,一个自监督编码器-解码器Transformer:编码器在无位姿条件下用全跨视角自注意力聚合冻结DINOv3 patch特征,解码器用PRoPE位姿条件化并施加BlockNN掩码把目标视角自注意力限制为逐点残差MLP,训练目标是对齐冻结DINOv3特征的潜空间重建并加入一阶空间有限差分惩罚;在RealEstate10K、DL3DV、Co3Dv2约11.7万序列上训练后,冻结编码器在点对应、视觉定位、相对位姿、相对深度与MimicGen机器人操作五项任务上匹配或超过自监督基线,并在相机偏移下比2D语义编码器退化更平缓。作者提出SNAP,一个自监督编码器-解码器Transformer:编码器在无位姿条件下用全跨视角自注意力聚合冻结DINOv3 patch特征,解码器用PRoPE位姿条件化并施加BlockNN掩码把目标视角自注意力限制为逐点残差MLP,训练目标是对齐冻结DINOv3特征的潜空间重建并加入一阶空间有限差分惩罚;在RealEstate10K、DL3DV、Co3Dv2约11.7万序列上训练后,冻结编码器在点对应、视觉定位、相对位姿、相对深度与MimicGen机器人操作五项任务上匹配或超过自监督基线,并在相机偏移下比2D语义编码器退化更平缓。SNAP用受限解码器与潜空间重建目标,让新视角合成预训练产出可迁移几何表征作者提出SNAP,一个自监督编码器-解码器Transformer:编码器在无位姿条件下用全跨视角自注意力聚合冻结DINOv3 patch特征,解码器用PRoPE位姿条件化并施加BlockNN掩码把目标视角自注意力限制为逐点残差MLP,训练目标是对齐冻结DINOv3特征的潜空间重建并加入一阶空间有限差分惩罚;在RealEstate10K、DL3DV、Co3Dv2约11.7万序列上训练后,冻结编码器在点对应、视觉定位、相对位姿、相对深度与MimicGen机器人操作五项任务上匹配或超过自监督基线,并在相机偏移下比2D语义编码器退化更平缓。作者提出SNAP,一个自监督编码器-解码器Transformer:编码器在无位姿条件下用全跨视角自注意力聚合冻结DINOv3 patch特征,解码器用PRoPE位姿条件化并施加BlockNN掩码把目标视角自注意力限制为逐点残差MLP,训练目标是对齐冻结DINOv3特征的潜空间重建并加入一阶空间有限差分惩罚;在RealEstate10K、DL3DV、Co3Dv2约11.7万序列上训练后,冻结编码器在点对应、视觉定位、相对位姿、相对深度与MimicGen机器人操作五项任务上匹配或超过自监督基线,并在相机偏移下比2D语义编码器退化更平缓。