arXiv 2026年10月6日作者提出 ExStereo 立体模块:用冻结的立体基础模型从双目图像重建度量点云,渲染为 Top/Front/Left/Right 四视图显式立体表征,经 ViT 编码后由动作 token 通过 action-stereo 交叉注意力选择性读取,并在大规模立体数据上以掩码自编码目标做 mid-training、再冻结模块做 post-training;在 RoboTwin 十个仿真任务上把平均成功率从 51.2% 提升到 76.4%,在双臂 PiPER 真机三任务上从 16/60 提升到 50/60,并优于点云与隐式立体基线。作者提出 ExStereo 立体模块:用冻结的立体基础模型从双目图像重建度量点云,渲染为 Top/Front/Left/Right 四视图显式立体表征,经 ViT 编码后由动作 token 通过 action-stereo 交叉注意力选择性读取,并在大规模立体数据上以掩码自编码目标做 mid-training、再冻结模块做 post-training;在 RoboTwin 十个仿真任务上把平均成功率从 51.2% 提升到 76.4%,在双臂 PiPER 真机三任务上从 16/60 提升到 50/60,并优于点云与隐式立体基线。ExStereo 用显式立体表征把 2D VLA 提升到 3D,仿真成功率从 51.2% 升至 76.4%、真机从 16/60 升至 50/60作者提出 ExStereo 立体模块:用冻结的立体基础模型从双目图像重建度量点云,渲染为 Top/Front/Left/Right 四视图显式立体表征,经 ViT 编码后由动作 token 通过 action-stereo 交叉注意力选择性读取,并在大规模立体数据上以掩码自编码目标做 mid-training、再冻结模块做 post-training;在 RoboTwin 十个仿真任务上把平均成功率从 51.2% 提升到 76.4%,在双臂 PiPER 真机三任务上从 16/60 提升到 50/60,并优于点云与隐式立体基线。作者提出 ExStereo 立体模块:用冻结的立体基础模型从双目图像重建度量点云,渲染为 Top/Front/Left/Right 四视图显式立体表征,经 ViT 编码后由动作 token 通过 action-stereo 交叉注意力选择性读取,并在大规模立体数据上以掩码自编码目标做 mid-training、再冻结模块做 post-training;在 RoboTwin 十个仿真任务上把平均成功率从 51.2% 提升到 76.4%,在双臂 PiPER 真机三任务上从 16/60 提升到 50/60,并优于点云与隐式立体基线。