arXiv 2026年10月5日该工作提出 OmniAct3D 框架,通过 ERP-Ray 几何适配器建模球面视线与周期空间结构、以视觉-动作推理链在全景上下文中定位证据并转化为结构化几何动作、并用外观引导朝向专家对目标区域高分辨率重编码,从而把透视预训练的视觉基础模型检测器适配到等距柱状投影全景图像;实验显示其在 Spheriverse 上较此前最佳 3D 检测器提升 2.96 NDS,在 PanoMMOcc 上较未适配的视觉基础模型基线提升 24.87 mAP,且在目标特定几何适配下 VARC 保留同配置 mAP 的 95–98%。该工作提出 OmniAct3D 框架,通过 ERP-Ray 几何适配器建模球面视线与周期空间结构、以视觉-动作推理链在全景上下文中定位证据并转化为结构化几何动作、并用外观引导朝向专家对目标区域高分辨率重编码,从而把透视预训练的视觉基础模型检测器适配到等距柱状投影全景图像;实验显示其在 Spheriverse 上较此前最佳 3D 检测器提升 2.96 NDS,在 PanoMMOcc 上较未适配的视觉基础模型基线提升 24.87 mAP,且在目标特定几何适配下 VARC 保留同配置 mAP 的 95–98%。OmniAct3D 将透视预训练视觉基础模型适配到全景 ERP,在 Spheriverse 上较此前最佳 3D 检测器提升 2.96 NDS该工作提出 OmniAct3D 框架,通过 ERP-Ray 几何适配器建模球面视线与周期空间结构、以视觉-动作推理链在全景上下文中定位证据并转化为结构化几何动作、并用外观引导朝向专家对目标区域高分辨率重编码,从而把透视预训练的视觉基础模型检测器适配到等距柱状投影全景图像;实验显示其在 Spheriverse 上较此前最佳 3D 检测器提升 2.96 NDS,在 PanoMMOcc 上较未适配的视觉基础模型基线提升 24.87 mAP,且在目标特定几何适配下 VARC 保留同配置 mAP 的 95–98%。该工作提出 OmniAct3D 框架,通过 ERP-Ray 几何适配器建模球面视线与周期空间结构、以视觉-动作推理链在全景上下文中定位证据并转化为结构化几何动作、并用外观引导朝向专家对目标区域高分辨率重编码,从而把透视预训练的视觉基础模型检测器适配到等距柱状投影全景图像;实验显示其在 Spheriverse 上较此前最佳 3D 检测器提升 2.96 NDS,在 PanoMMOcc 上较未适配的视觉基础模型基线提升 24.87 mAP,且在目标特定几何适配下 VARC 保留同配置 mAP 的 95–98%。