跳到主要内容
返回时间线
arXiv来源发表:

EVO-WAM 让世界动作模型从自生成视频中自训练,RoboTwin 未见任务成功率从 26.9% 升至 68.0%

核心概要

该工作提出 EVO-WAM 框架,通过状态预测与锚定多帧上下文实现无外部执行反馈的自回归 rollout,再用视觉语言模型筛选完成任务的前缀、用逆动力学模型校验视频-动作一致性,并迭代自训练世界动作模型;在 RoboTwin 2.0 的七个未见任务上把 Cosmos3 平均成功率从 26.9% 提升到 68.0%、DreamZero 从 28.5% 提升到 46.4%,在真实世界三个长程复合任务上把 Cosmos3 从 20.0% 提升到 76.7%。

AI-generated editorial illustration: EVO-WAM: Evolving World Action Models through Video-Action Verification

深度剖析

EVO-WAM 让世界动作模型仅凭自身生成的视频-动作轨迹改进未见任务,无需额外专家演示,也无需在自演化过程中于外部环境执行候选动作。 此前用世界模型生成经验做策略改进的方法仍依赖独立世界模型或任务演示,而该工作把 WAM 自身的联合视频-动作预测直接当作监督来源。 在 Cosmos3 与 DreamZero 两个骨干、七个未见 RoboTwin 2.0 任务上验证,每任务 100 次 Clean 与 100 次 Randomized 试验;真实世界用 Franka 机器人、每任务十次试验。

两阶段验证——视觉语言模型挑选完成任务的前缀、逆动力学模型校验视频-动作一致性——是自训练获得实质增益的关键。 消融显示仅用 VLM 检查视觉完成度在第四轮为 43.7%,加入 IDM 后为 68.0%;VLM + Simulator 为 72.7%,但需要目标任务的模拟器,而 IDM 方案可迁移到真实世界。 同一 Cosmos3 30K 初始化、每轮 2,800 候选、四轮各 1,000 次更新、1:1 记录/生成采样比的受控对比;验证器可靠性分析中 IDM 把误接受从 63 降到 15,精确率从 68.0 升到 86.0,召回率从 64.4 降到 44.2。

自训练收益在首轮最大,后续轮次增益变小并偶有回退,但累积已验证前缀比只用最新一轮数据更稳。 Cosmos3 在 RoboTwin 上第一轮从 26.9% 升到 58.3%,第四轮达 68.0%;只用最新一轮数据在第四轮回落到 53.6%,而累积数据为 68.0%。 四轮自训练序列与累积/最新数据对照表;真实机器人上第二轮与第四轮均为 76.7%,第三轮为 73.3%。

改进可泛化到新场景,且基本保留已见任务性能。 在新采样的 100 个场景/任务条件下,EVO-WAMCosmos3 达 70.4%,基线为 24.9%;在 43 个已见任务上为 84.8%,34K Cosmos3 基线为 85.8%。 新场景测试每任务 100 Clean 与 100 Randomized 试验共 1,400 次;已见任务每任务 50 Clean 与 50 Randomized 试验。

启示与展望

该结果面向希望在不采集新演示的情况下把世界动作模型适配到未见任务的机器人学习研究者与工程团队,适用于具备可生成视频-动作 rollout 的 WAM 骨干、且能训练或获得逆动力学模型的场景;仿真侧在 RoboTwin 2.0 的七个未见任务上验证,真实侧在 Franka 机器人、三个长程复合任务上验证。方法本身不要求在自训练期间执行候选动作,因此也适用于难以安全试错的真实环境。

后续轮次增益变小并出现回退,说明额外自训练并不总是提升性能,何时停止、如何选择轮次仍是开放问题;DreamZero 在空杯放置与积木堆叠上提升有限,作者将其归因于其生成候选中可用行为的约束。验证器可靠性分析显示 IDM 提高精确率但降低召回率,且这些标签描述的是完整动作带重放而非单独执行所选前缀;模拟器失败也可能来自物理伪影。真实机器人每任务仅十次试验,布局数有限。这些是范围与开放问题,而非缺陷。

来源