SWAP 用离线强化学习在 VLA 策略间逐步路由,DROID 真实任务成功率从 63.3% 提升到 96.7%
核心概要
SWAP 把机器人策略路由建模为离线强化学习问题,用 IQL 训练一个路由 critic,在每个动作块之后根据当前观测从多个预训练 VLA 策略中选出预期长期回报最高者;在真实 DROID 桌面操作上,成功率从最佳单一策略的 63.3% 提升到 96.7%,成功轨迹的平均动作步数从 269 降到 193(减少 28.3%),并在 LIBERO 与 LIBERO-Plus 仿真中优于固定策略与随机路由。
Fig. 1 : Policy routing for robot manipulation. We introduce SWAP, an offline reinforcement learning framework for online policy routing. Given candidate robot policies, SWAP dynamically selects the best policy online for an instruction and current observation during task execution.
arXiv深度剖析
提出逐步策略路由框架 SWAP,把"选哪个策略"本身当作离散动作空间的离线强化学习问题,学习一个路由 critic 估计每个候选策略在当前观测下的长期效用。 以往 VLA 部署默认整段 episode 只用单一策略,或仅在 episode 开始时选一次;SWAP 在每次动作块执行后重新评估并可在同一轨迹内切换策略,且把候选策略当作固定黑盒,新增策略无需重训任何专家。 在真实 DROID 三任务上,SWAP 平均成功率 96.7%,最佳单一策略 63.3%,随机路由 66.7%;每个任务 10 次留出试验,训练数据为每策略每任务 10 次成功与 10 次失败 rollout,共 180 条轨迹。
路由 critic 学到结构化的、与任务阶段相关的策略偏好,而非随机组合:早期自由空间移动偏好某一策略,接近抓取等精细操作时切换到另一策略,掉落失败后重新选回以恢复。 这给出了"切换本身有价值、但学习切换对象贡献更大"的分解证据:随机路由仅比最佳固定策略高 3.4 个百分点,而 SWAP 比随机路由再高 30 个百分点。 Q 值分析显示较弱策略在 36% 的时间被赋予较低价值,另一策略在 64% 的时间被赋予较高价值;SWAP 平均每次 rollout 切换 8.7 次,每次切换对应平均 +0.117 的 Q 值提升;按轨迹三分段统计,中段与末段某策略被选中比例分别为 77.4% 与 63.7%。
路由在分布偏移下仍能迁移:在 DROID 加入未见过的干扰物体、且不重训 critic 时,SWAP 取得 90% 与 80% 成功率,而最佳单一策略为 40% 与 30%。 说明 critic 对新颖场景本身具有泛化性,限制因素在于候选策略的相对强弱是否在偏移下保持稳定,而非路由机制失效。 LIBERO-Plus 上五个异构策略的排名发生反转,SWAP 达 62.65%,随机路由崩塌至 2.7%;移除在训练分布上最强但在偏移下退化的策略后,SWAP 升至 70.65%。
在候选集合包含一个强策略与一个明显弱策略时,SWAP 能识别并优先使用强策略,性能匹配或超过该强策略本身。 表明路由不会因存在低质量候选而被拖累,且 SWAP 仅在 LIBERO-Spatial 的 8 个任务上训练、在 2 个未见任务上评估时仍成立。 LIBERO-Plus 上 SWAP 达 89% 成功率,接近更强单一策略,而随机路由降至 79%。
启示与展望
该工作面向拥有多个预训练 VLA 策略、且能采集到成功与失败离线轨迹的桌面操作场景,适用于短程任务与少量候选策略(真实实验为三个策略,仿真最多五个)。方法在动作块粒度路由,与底层 VLA 的推理节奏对齐,不引入额外策略查询,因此适合已有 chunked 动作输出的策略库。对希望在不重训专家模型的前提下组合异构策略、或在分布偏移下维持成功率的工程团队,这一框架提供了可直接沿用的训练流程:离线收集各策略 rollout、用 IQL 拟合双 Q critic、部署时按最高价值选择策略。
候选策略数量扩展到数十或数百个时的路由行为尚不清楚,尤其在更强的分布偏移下;评估限于短程桌面操作,长程任务中稀疏终局奖励对 critic 的训练信号会变弱,可能需要中间子任务完成信号;候选集合增大后查询多个异构策略带来的系统开销可能影响端侧部署;当前目标只优化任务回报,未纳入推理延迟或成本。此外,本文为全文解析,但部分图表以图像形式给出,表 II 与表 III 的具体数值需结合原文图表核对。
