跳到主要内容
返回时间线
arXiv来源发表:

CARE 把机器人执行失败变成训练数据:仿真成功率平均提升 14.5 分、真机提升 15.9 分

核心概要

该工作提出 CARE 框架,先收集失败 rollout 并建模分阶段的失败后几何偏差分布,据此合成代表性失败状态与纠正示范,再在推理时用分阶段规划配合基于三维点云的物理监控触发原子级调整或重操作,并在 RoboTwin 2.0、RoboFactory、新提出的 FSR-Bench 与真机双臂任务上验证,仿真平均任务成功率提升 14.5 分、真机提升 15.9 分、FSR-Bench 恢复成功率提升 7.5 分。

AI-generated editorial illustration: CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies

深度剖析

CARE 把执行失败本身当作结构化监督信号:先在不加纠正监督的情况下执行标称原子计划,从 100 次 rollout 中收集未满足终止条件的失败,用相对平移与偏航偏差刻画分阶段失败后偏差分布,再从中采样并扰动阶段相关相对位姿、在物理动力学下前向滚动,得到新的物理失败状态,并由仿真中的 IK/运动规划 oracle 或真机中的人类遥操作生成短程纠正示范。 此前方法多依赖人工设计或随机扰动来采集纠正示范,或把失败当作需要回滚消除的异常;CARE 显式建模“策略自身执行所诱导的”分阶段失败后偏差分布,并用它指导纠正数据合成。 论文报告失败建模基于 100 次初步 rollout,并对每个标量偏差变量在 Gaussian、Beta、Gamma、Weibull、Log-Normal、Uniform 等分布族中用拟合优度与 AIC 选择;消融显示 50 次 rollout 明显偏弱,100 与 150 次差异很小,100 次时各变量与全量分布的 JS 散度降至 0.0224、0.0200、0.0374、0.0245。

CARE 把长程操作拆成原子阶段,用 GPT-4.1(temperature 0)在任务初始化时一次性生成阶段计划,包含标称原子指令、几何线索、阶段终止谓词以及阶段内调整与阶段后重操作指令;执行期由一个点云谓词检查器式的三维监控器在抓取闭合、物体释放等阶段关键转换处触发检查,用 SAM 3 提取夹爪、物体、目标区域掩码、Depth Anything 3 提供深度,融合成点云并计算紧凑几何状态,据此选择继续、调整或重操作。 与依赖 VLM 判断、世界模型或回滚的方法不同,CARE 用技能级几何谓词模板而非任务专用学习分类器,且标称、调整、重操作三类指令由同一个 VLA 执行器执行,无需切换到单独的恢复策略。 监控机制消融在三个仿真与两个真机任务上比较 GPT-4.1 VLM 监控器与三维监控器,平均准确率从 71.4% 提升到 93.8%(+22.4 分),端到端延迟从 3.40 秒降到 0.24 秒;扩展任务上监控平均准确率为 93.2%。

论文提出 FSR-Bench,从中间失败状态而非干净初始状态开始评估恢复能力,包含五个任务共 36 个恢复场景,分为 21 个通常只需一次纠正操作的 Easy 局部失败与 15 个需要多步纠正或双臂协同的 Hard 结构失败;其恢复训练数据在预设范围内均匀采样扰动,而评估初始化来自标称策略 rollout 估计的分阶段经验失败分布,并在物理动力学下前向滚动生成新失败状态。 既有操作基准多从预定义初始状态衡量任务执行,对中间失败恢复支持有限;FSR-Bench 把恢复成功率与标称任务执行分开报告,并刻意让训练分布与测试分布解耦。 每个任务-难度对的恢复成功率在 100 次试验上计算,所有方法与 CARE 变体使用相同的预生成失败初始化和相同的 50 条均匀采样纠正轨迹,因此比较隔离的是原子纠正执行本身。

在多个 VLA 主干、仿真基准与真机双臂任务上,CARE 带来一致提升:RoboTwin 2.0 上 π0 平均成功率从 39.6% 升到 60.7%(+21.1 分)、π0-FAST 从 17.4% 升到 33.1%(+15.7 分);RoboFactory 上 π0-FAST 与 π0 平均绝对增益分别为 +9.3 与 +12.0 分;FSR-Bench 上 π0 的 Easy 平均恢复成功率从 38.8% 升到 57.2%、Hard 从 15.8% 升到 21.2%;真机 SO-101 双臂平台上 π0 从 30.8% 升到 50.0%、π0-FAST 从 18.8% 升到 31.3%,分别超过复现的 FailSafe 专用恢复基线 13.7 与 7.3 分。 这些结果把“执行失败可提供有效纠正监督”这一主张从单一主干、单一基准扩展到连续与离散动作建模主干、多臂协作、恢复专用基准与真机部署。 仿真与真机均采用匹配数据预算(如标准仿真任务 150 条标称专家示范加每类错误 50 条额外轨迹,真机每任务 50 条标称示范加每类错误 20 条),真机每任务 100 次试验;组件消融显示数据与执行两部分叠加时增益最大,且经验引导采样比均匀随机采样平均高 12.2 分(π0)与 8.8 分(π0-FAST)。

启示与展望

该工作面向长程多臂 VLA 操作,适用于存在明确原子阶段与阶段关键几何事件(如抓取闭合、物体释放)的任务,并已在 RoboTwin 2.0、RoboFactory、FSR-Bench 与双机械臂 LeRobot SO-101 平台上验证。它使后续工作可以复用“失败分布建模加原子纠正执行”的流程、FSR-Bench 的恢复评估协议,以及技能级几何谓词模板;对希望在不更换主干模型的前提下提升恢复能力的研究者与工程团队,这条路径把恢复能力变成数据与执行机制层面的可复用组件。论文也指出未来工作将把强化学习整合进 CARE 以进一步增强恢复。

三维监控依赖 SAM 3 与 Depth Anything 3 的分割与深度估计,其在新物体、新场景下的表现是值得继续观察的方向;几何容差由 rollout 统计标定,迁移到新原子技能时需要重新定义谓词模板并校准数值。FSR-Bench 的 Hard 结构失败恢复成功率整体仍处于较低水平(如 π0 为 21.2%),说明多步纠正与双臂协同恢复仍是开放问题。此外,失败分布估计以 100 次初步 rollout 为实用折中,任务或平台变化时该预算是否仍然足够,以及把强化学习纳入 CARE 后与现有纠正监督如何分工,都是后续可追踪的问题。

来源