DRIVE 将成功轨迹多样性变为 RL 目标,在仿真与真机上提升 VLA 分布外泛化
核心概要
作者分析了视觉-语言-动作(VLA)策略的强化学习微调(RFT)如何重塑探索行为,发现 RFT 在整体行为分布收缩的同时使成功轨迹更加多样、更易被采样、覆盖更广的任务有效解空间;据此提出 DRIVE,将匹配任务条件下分组轨迹的时序对齐相似度转化为仅对成功轨迹生效的内在奖励,在 LIBERO-Plus、ManiSkill3、RoboTwin 2.0 上提升分布外成功率,并在双臂 AgileX PiPER-X 平台上将平均分布外成功率从 64.1% 提升到 73.3%。
Figure 1: Beyond task success, diverse successful trajectories reveal broader solution modes. This diversity provides a new opportunity for improving VLA generalization.
arXiv深度剖析
RFT 会同时产生两种相反趋势:所有 rollout 之间的归一化 GAK 相似度上升,而成功 rollout 之间的相似度下降,说明整体行为收缩掩盖了成功模式的多样化。 此前工作主要关注任务奖励优化带来的性能提升,较少刻画 RFT 过程中成功行为分布如何演化;该分析把“成功模式覆盖度”单独提出来作为观察 RFT 的视角。 在 ManiSkill3 上比较 SFT 与中间/最终 RFT 检查点,使用匹配任务条件下的 SDE 采样,分别对全部与成功轨迹测量相似度;成功率从 41% 升至 75%、从 52% 升至 77%。
RFT 让潜在的成功行为更易被触发,并在相同采样预算下覆盖更广的任务有效解空间。 用 Pass@k 衡量成功可触发性、用基于归一化 GAK 匹配的 Coverage@k 衡量成功广度,把“更易成功”与“成功方式更多”区分开。 在 32 个任务初始状态配置上对 SFT 与最终 RFT 各采样至多 256 条 rollout;Coverage@k 以 SFT 成功轨迹为参照并采用留一匹配避免自匹配。
DRIVE 把分组轨迹的时序对齐相似度转成成功条件下的相对多样性势能,并通过基于势能的奖励塑形保持最优策略不变。 与无监督技能发现、策略多样化或全局行为差异不同,DRIVE 只在匹配任务条件下比较轨迹,且只对成功轨迹发放多样性奖励,避免奖励失败或纯粹的时序差异。 轨迹用策略已计算的 VLM 前缀表示做均值池化,加入终止观测,用 GAK 动态规划聚合所有单调对齐路径并做自相似归一化;定理 1 给出最优策略不变性证明。
在三个仿真基准与真机双臂平台上,DRIVE 相对 Vanilla RFT 提升分布外成功率。 在相同 SFT 初始化与统一 PPO + Flow-SDE 流程下,与 Higher Noise、KL 正则、Clip-Higher 等采样/策略/优化层面的干预相比,DRIVE 在两个骨干上取得最高的基准族宏平均。 两个骨干各改善 12 个基准-划分结果中的 11 个,OOD 宏平均分别从 48.1% 到 53.4%、从 71.1% 到 73.1%;真机两个任务、三种分布偏移下平均 OOD 成功率从 64.1% 到 73.3%,每个任务-条件组合 20 次试验。
启示与展望
该结果面向使用 PPO 与 Flow-SDE 流程对 VLA 策略做强化学习微调的机器人操作场景,适用于匹配任务条件下可分组采样的设定;作者指出未来可扩展到更长时域任务、更广的具身形态以及在线真机微调,以进一步检验可扩展性与通用性。
组内成对 GAK 比较带来额外计算开销,且多样性度量依赖 VLM 表示能否捕捉有意义的行为差异;OOD 性能在训练检查点间波动较大,并非单调上升,因此单看域内性能不足以刻画泛化;真机评估覆盖两个任务与三种分布偏移、每个任务-条件组合 20 次试验,更广任务与具身形态下的表现仍是开放问题。
