RoboCoach 用世界模型想象失败来挑选示范:仅 150 条子任务示范把 Franka 成功率从 13.3% 提到 75.0%
核心概要
该工作提出 RoboCoach,一个由世界模型引导的主动教练框架,其 Route–Imagine–Diagnose–Improve(RIDI)循环让可复用技能专家在共享动作条件世界模型 CoachWorld 中闭环执行,用进度判定器记录首个未完成的子任务,再据此决定采集哪些子任务示范、更新哪些专家适配器;在 LIBERO 与 RoboTwin 两套仿真和 Franka 与 AgileX 两个真机平台上,想象成功率与实机成功率在 22 个任务–策略对上 Spearman 相关为 0.840,每平台仅增加 150 条子任务示范后 Franka 成功率由 13.3% 升至 75.0%、AgileX 由 40.0% 升至 83.8%,并在四个留出组合上取得
深度剖析
把“教什么”和“更新哪里”耦合为一个决策:以子任务–专家对为基本单位,让可复用技能成为数据采集与策略适配的共同目标。 以往主动/纠正式模仿学习多决定在哪里补充监督,模块化策略多决定更新哪个组件,该工作把两者显式绑定到同一个子任务–专家对上。 在 LIBERO 与 RoboTwin 上以匹配的示范预算、LoRA 训练设置与评测协议比较四种条件(Single VLA + Uniform、Single VLA + WM-targeted、Modular + Random、RoboCoach),并报告逐轮与逐任务结果。
RIDI 循环把世界模型从“模拟更多经验”转为“决定稀缺真实经验投向何处”:在 CoachWorld 中闭环想象、用进度判定器定位首个超时子任务,再按任务均衡的首超时质量排序请求示范。 世界模型此前多用于策略评估、策略优化或生成额外监督,这里被用于定位瓶颈技能专家并分配示范。 想象与实机成功率在 22 个任务–策略检查点对上 Pearson 与 Spearman 相关分别为文中报告值(Spearman 为 0.840);进度判定器在参考视频回放上 Switch MAE 为 0.414 秒、Recall@1.0s 为 82.73%、outcome F1 为 88.21%,在 CoachWorld 生成观测上分别为 0.815 秒、62.73% 与 83.84%。
在固定示范预算下,把同样的定向示范送给对应技能专家,比送给共享全局适配器更有效。 该对照分离了“定向采集”与“更新位置”两个因素:相同数据下共享更新与专家更新的差异被单独测量。 共享适配器下定向采集相对均匀采集在 LIBERO 与 RoboTwin 上分别改变最终成功率若干百分点;把相同定向示范用于选定专家再额外增加若干百分点;模块化系统内世界模型定向超过随机目标选择若干百分点(具体数值见正文与附录表格)。
受训专家可沿未见的任务路线重组:四个留出组合(更长延续、跨任务组合、技能重排)平均成功率 35.0%,共享策略基线为 0%。 留出路线及其语义改写被排除在策略与判定器训练、教练数据、路由示例、阈值校准与检查点选择之外,因此评测隔离的是已学技能在新路线上的复用。 每个路线 20 次真机试验:Case A 13/20(65%)、Case B 3/20(15%)、Case C 5/20(25%)、Case D 7/20(35%),基线四例均为 0/20。
启示与展望
该结果面向长程操作中由可复用原子技能构成的任务,适用于具备共享 VLA 骨干、技能专家库、可用相机标定以及能按请求采集示范的人类操作员的设置;仿真结论来自 LIBERO-Long 十个任务与 RoboTwin 2.0 五个双臂任务,真机结论来自 Franka Research 3 与 AgileX dual-Piper 上的七个任务,每任务仿真 50 次、真机 20 次试验。它使后续工作可以沿两条线推进:一是把“想象失败→定向示范→专家更新”的循环扩展到更多形态与更长路线,二是把世界模型当作决定监督投向的调度器而非单纯的模拟器。
仍值得留意的是:当被操作物体被遮挡、或接触与碰撞发生在相机视野之外时,物理建模与预测变得困难,而 RoboCoach 依赖能保留任务相关证据的动作条件预测;多种子一致性可降低对随机波动的敏感性,但无法排除系统性的世界模型偏差;专家库由技能语义预先定义,其结构学习与减少人类示范需求仍是开放方向。此外,本总结基于论文全文与附录表格,未包含项目页或代码仓库中的额外材料,因此关于实现细节与复现成本的问题仍需查阅原文与项目页。
