跳到主要内容
返回时间线
arXiv来源发表:

VLA-Precision 用非对称协同自举把九项化学精密操作的平均成功率做到 98.3%,单任务在线训练 45.8 分钟

核心概要

该工作提出面向大型视觉-语言-动作(VLA)模型真实世界在线强化学习的 VLA-Precision 框架,包含跨时间尺度的非对称协同自举(ACoB)算法与 ACoB-Stream 训练架构,在四类九项高精度化学操作任务和四种机器人平台上取得 98.3% 平均成功率、平均每任务 45.8 分钟在线训练、27.6 秒单回合,并报告吞吐与计算效率最高提升 10.9 倍。

AI-generated editorial illustration: VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models

深度剖析

ACoB 把快速行为学习与渐进式价值校准耦合在不同时间尺度上:早期由人工干预引导的行为克隆迅速吸收成功动作与人工纠正,同时全局回报传播与局部偏好排序随自主经验积累不断校准价值估计,再以相对动作优势驱动带参考正则的策略改进。 既有真实世界 VLA 强化学习多用行为克隆约束策略分布以稳定探索,但这类约束对价值估计本身帮助有限;ACoB 把行为克隆用作加速经验质量的手段,并额外引入状态匹配的局部偏好排序来修正被覆盖提案的价值。 消融实验在四项代表性任务上给出对照:完整 ACoB 最终自主成功率 96.25%、干预率 0.03%;去掉 critic preference 降至 26.25%、去掉 actor BC 降至 20.00%、把相对优势换成直接 Q 最大化降至 8.75%,干预率分别升至 10.57%、9.24%、24.93%。

ACoB-Stream 以不变状态解耦与按需流式化为设计原则,围绕经验上下文状态与策略状态的生命周期管理四个阶段:经验上下文形成、持久化、访问与策略状态同步。 此前面向紧凑策略的异步 actor–learner 系统依赖重放密集型优化,其成本随大型 VLA 放大;ACoB-Stream 改为跨更新复用冻结前缀 KV 上下文、上下文去重加磁盘支撑的滑动窗口采样、目标对齐的上下文检索,以及只发布可训练动作专家状态而非整模型同步。 系统对比中,Disk ACoB-Stream 在 150 分钟内完成 15,666 次 CTA 循环,达 1.7407 CTA/s、单循环 0.574 秒;相对 No KV Cache 吞吐为 10.95 倍、平均延迟降低 90.9%;相对 Naive Context Access 吞吐为 1.80 倍、平均延迟降低 44.4%;相对 Dynamic CPU RAM 吞吐为 1.09 倍、延迟降低 8.0%。

在九项高精度化学操作任务上,VLA-Precision 取得 98.3% 平均成功率、平均每任务 45.8 分钟在线训练、27.6 秒平均回合时间,并在 180 次留出试验中成功 177 次,七项任务达 100%、每项任务至少 90%。 同一套任务上,HIL-SERL 平均成功率 2.8%、ConRFT 7.8%、Robo-Dopamine 10.0%,仅靠演示微调的两个大型 VLA 基线分别为 59.4% 与 67.8%;VLA-Precision 相对最强真实世界 RL 基线 Robo-Dopamine 平均成功率提升 88.3%、执行速度提升 61.2%。 结果来自四种机器人平台(两种 UR5e 单臂配置、UR5e 双臂、Franka Research 3)上的真实世界实验,任务覆盖接触密集、轻接触、无接触与双臂协调四类,并在每项任务中刻意随机化物体位姿与初始臂位姿。

离线对比显示在线强化学习能在演示微调之上继续提升任务策略:VLA-Precision 在五项代表性任务各 20 次试验中成功 99 次,两个仅演示微调的基线分别为 61 次与 50 次,平均成功时间 26.65 秒对 29.32 秒与 32.05 秒。 VLA-Precision 使用的演示数量更少(60–120 条对 120–200 条)、Stage-I 步数更少(5,000–15,000 对 25,000–30,000),说明增益来自 Stage-II 在线强化学习而非更多监督数据。 该对比为每方法每任务 20 次试验的离线测试,双臂试管刷洗任务上两个基线分别降至 10% 与 5%,VLA-Precision 为 95%。

启示与展望

该工作面向已经具备任务级能力的预训练大型 VLA,在真实机器人上做在线后训练,适用于位置与角度容差很紧的精密操作场景,例如化学实验室中的试管架装载、移液与瓶塞插入。它给出的是任务特定策略的改进路径:先用演示做全参数模仿学习得到任务先验,再冻结主干、只训练动作专家中的 LoRA 参数。对希望减少人工干预、缩短单任务在线训练时间、并在有限算力与内存下维持更新吞吐的团队,ACoB 与 ACoB-Stream 提供了可复用的算法与系统设计参考。作者也把长时程双臂真实世界强化学习与多任务联合优化列为后续方向,并指出随着执行时域增长,逐步增量动作表示会累积预测误差,因而倾向在长时程双臂操作中采用块级增量。

需要留意的是,全部结果来自作者自建的高精度化学操作任务套件与四种机器人平台,任务数量与形态虽多,但仍属特定场景;对比基线为作者复现或引用的既有方法,其调参预算与本文不完全等同。消融实验在四项代表性任务上进行,系统对比在特定硬件与 150 分钟窗口内测量,吞吐与延迟数字会随硬件、数据规模与实现细节变化。长时程双臂任务只包含一项,作者也指出更长序列中局部误差累积的问题尚未充分展开;多任务联合优化、任务条件价值学习与灾难性遗忘控制仍属开放问题。此外,本文以摘要与正文可见内容为准,图表中的逐任务曲线细节未逐一展开,读者若需复现具体数值应回到原文图表核对。

来源