ExStereo 用显式立体表征把 2D VLA 提升到 3D,仿真成功率从 51.2% 升至 76.4%、真机从 16/60 升至 50/60
相关研究与后续进展核心概要
作者提出 ExStereo 立体模块:用冻结的立体基础模型从双目图像重建度量点云,渲染为 Top/Front/Left/Right 四视图显式立体表征,经 ViT 编码后由动作 token 通过 action-stereo 交叉注意力选择性读取,并在大规模立体数据上以掩码自编码目标做 mid-training、再冻结模块做 post-training;在 RoboTwin 十个仿真任务上把平均成功率从 51.2% 提升到 76.4%,在双臂 PiPER 真机三任务上从 16/60 提升到 50/60,并优于点云与隐式立体基线。
Fig. 1: ExStereo is a stereo module that enables 3D spatial perception in pre-trained, off-the-shelf Vision-Language-Action models. Given a stereo image pair, it constructs four orthogonal views of the scene with metric 3D coordinates. This explicit 3D representation allows the models to selectively retrieve visual features relevant to the action tokens through our proposed action-stereo cross-attention mechanism, improving robotic manipulation performance.
arXiv深度剖析
ExStereo 把预训练 2D VLA 提升为具备度量 3D 感知的策略,且无需重新预训练基座模型。 此前 StereoVLA 需从头训练 VLA,StereoPolicy 对预训练 VLA 仅带来有限提升;ExStereo 以可插拔模块形式接入现成 VLA。 在 RoboTwin 十个任务上平均成功率由 51.2% 升至 76.4%,SmolVLA 由 18.7% 升至 42.0%;真机三任务合计 50/60 对基线 16/60。
显式立体表征在动作专家中直接使用,优于把隐式立体特征拼进 VLM 的做法。 论文将 StereoVLA/StereoPolicy 归为隐式表征,并首次系统对比显式多视图 token 直接进入动作专家的效果。 消融中显式特征在 Lift Pot 为 66.7、Open Laptop 为 72.0,隐式特征分别为 32.0 与 20.0;真机上 StereoVLA 为 11/60,低于 RGB 基线。
引入带掩码自编码目标的 mid-training 阶段,使策略能在不完整观测下学习稳健 3D 表征。 在预训练与任务 post-training 之间插入中间阶段,用 StereoEngine 生成的大规模立体数据训练,post-training 时冻结立体模块以防过拟合。 带 MAE 的 mid-training 在 Lift Pot 为 61.3、Open Laptop 为 92.0,均高于不带 MAE 的 57.3 与 90.7;去掉 mid-training 后真机降至 36/60。
启示与展望
该结果面向配备标定双目相机、以桌面平面为主要工作面的双臂操作场景,适用于希望在不重训基座 VLA 的前提下快速获得度量 3D 感知的研究者与工程团队。方法依赖冻结的 Fast-FoundationStereo 与 StereoEngine 生成的大规模立体数据,mid-training 任务与评测任务在任务与物体上均不重叠,post-training 仅用 100 条干净演示,说明该流程在有限任务演示下即可适配。
立体基础模型在远处、无纹理与细薄结构上可能退化,其误差会传导到多视图观测;点云来自单一立体视角,遮挡区域在四个渲染视图中都会留下空洞;多视图渲染假设存在桌面平面来定义世界坐标系,在杂乱或非桌面场景中未必成立;mid-training 数据来自单一基准与单一双臂本体,向更大立体机器人数据集与更多本体的扩展仍是开放方向。此外,mid-training 在部分任务上带来性能下降,作者将其归因于 mid-training 任务选择,并推测选用与 post-training 更相似的任务可能缓解,这一点尚待验证。
