跳到主要内容
返回时间线
arXiv来源发表:

Robo-COP让机器人编排器与VLA策略在部署中共同进化,仿真留出成功率从64.8%升至73.8%、真机从38.3%升至50.0%

核心概要

Robo-COP让机器人系统的VLM编排器与VLA策略在部署过程中共同进化:它把自身执行切分为技能级示范(即使整段失败也保留成功技能),在数据足以应对反复失败时才微调策略,并在采纳新检查点前按目标技能、整体任务成功率和既有技能做验证,同时修订围绕旧策略形成的记忆;在十个RoboLab仿真任务上把平均留出成功率从冻结策略的64.8%提升到73.8%,在三个真机任务上从38.3%提升到50.0%。

Source-provided article image: Co-Evolving Robot Orchestrators and Policies through Deployment
Figure 1 ·

Figure 1 : Two coupled loops for deployment-time improvement. The inner loop adapts the harness through episode reflection. The outer loop uses collected experience to update the policy, then revises memory so the harness can reassess the policy’s capabilities.

arXiv

深度剖析

把部署期学习重新表述为智能体式编排器与其策略的共同改进,而不是只改进其中一方。 此前的编排框架假设策略固定,只能绕开策略失败;Robo-COP同时更新策略并修订围绕旧检查点形成的记忆。 方法层面的框架贡献,并在仿真与真机实验中作为完整系统运行。

无需人工标注,把部署执行整理成技能级示范,并保留失败回合中成功的技能。 经验整理按片段独立于回合结果评估:文本裁判提出并标注技能,视频裁判用采样帧确认成功或明确的部分进展,因此一次成功抓取即使随后掉落仍可进入训练集。 由文本与视频两级裁判的接受规则支撑,附录给出分段规则与裁判输出。

在采纳前验证每个候选策略,并在每次更新后修订依赖策略的记忆。 验证在技能层面而非仅回合层面进行,检查目标技能、任务成功率以及此前采纳技能是否退化;采纳或回退后,劝阻使用VLA的建议被标记为对当前检查点未经验证而非删除。 仿真中12个候选有5个被拒绝;在首个候选被回退的四个任务上,固定日程在三个任务上低于冻结策略基线。

在仿真与真机上都取得留出成功率提升,且学习过程不牺牲部署期成功率。 仿真平均留出成功率从64.8%升至73.8%,固定日程无验证仅到65.8%;真机从38.3%升至50.0%;部署期成功率为73.2%,高于冻结策略的68.7%与固定日程的70.3%。 十个仿真任务各100次部署试验与50次留出初始化,三个真机任务各50次学习试验与20次留出测试,采用单次学习运行协议。

启示与展望

该结果面向在部署中边执行任务边学习的机器人系统:编排器以脚本化运动原语和VLA策略为工具,训练数据全部来自自身执行,因此适用于策略与脚本工具至少能部分演示目标技能的场景。仿真覆盖十个RoboLab任务,分为预训练VLA可独立解决、脚本原语可解决、以及两者单独都不足三类;真机覆盖三个任务,时限分别为40、60、90秒。对读者而言,这提供了一条可复用的部署期改进路径:技能级数据整理、训练时机控制、候选验证与记忆修订可以分别评估,也说明在脚本原语已覆盖的任务上程序搜索式方法仍有优势。

仍待观察的是:方法只能学习策略与脚本工具已能部分演示的技能;真机部署需要人工重置,每次策略更新都带来整理、训练与评估开销;在脚本原语已覆盖的任务上,ASPIRE的程序搜索优于Robo-COP;作者也指出可扩展性仍需在更大规模实验中验证。此外,跨任务技能池化训练单一策略被列为未来方向,尚未在本文中检验。

来源