跳到主要内容
返回时间线
arXiv来源发表:

StructRL 用可验证子任务奖励把长程 VLA 成功率从 41.5% 提到 49.1%

核心概要

StructRL 是一个在线强化学习框架,它把每条长程指令自动分解为可由环境状态二值验证的子任务并组织成有序依赖组,只在某子任务的全部前置条件完成后才发放中间奖励、并按完成快慢缩放奖励幅度,在 RoboCasa365 与 LIBERO-Long 上配合 GR00T-N1.5 和 π0.5 两个 VLA 主干,一致优于所评估的在线 RL 基线(如 GR00T-N1.5 上 RoboCasa365 由 41.5% 提升到 49.1%,LIBERO-Long 由 92.4% 提升到 96.6%)。

AI-generated editorial illustration: StructRL: Online Structured Reinforcement Learning for Long-Horizon Vision-Language-Action Tasks

深度剖析

StructRL 把长程任务指令分解为可验证子任务并赋予依赖结构,用“结构感知奖励门控”保证只有前置子任务全部完成后,某次检测到的完成才被计入中间奖励,且每个子任务最多贡献一次奖励。 此前在线 VLA RL 多依赖整段任务成功后才给出的终端奖励,或依赖学习到的标量进度估计;前者无法区分早期失败与接近成功的 rollout,后者不指明哪些前置事件使一次完成成为有效进展。StructRL 把“事件是否发生”和“该事件在已完成事件序列下是否构成有效进展”一并编码进奖励。 论文给出形式化定义(前置集合与门控指示函数),并在 RoboCasa365 的 16 个厨房任务上给出分解示例,如 Pack Lunch 中“Close Box”只有在两件物品都放入后才算有效进展。

StructRL 用“动态奖励节奏”按完成快慢缩放奖励:以 SFT 演示中前置条件首次满足到该子任务完成的平均间隔为参照,完成越快奖励越大,并给出奖励上限参数。 固定幅度的子任务奖励无法区分直接完成与包含多余游走的延迟完成,会模糊长程 rollout 中的信用分配;StructRL 把演示时长作为节奏基准引入奖励幅度。 消融显示,在 GR00T-N1.5 上先加入子任务奖励使 RoboCasa365 成功率由 41.3% 升至 47.4%、LIBERO-Long 由 91.2% 升至 94.7%,再加动态节奏分别提升 0.5 与 1.2 个百分点,再加结构门控再提升 1.3 与 0.5 个百分点,最终达到 49.2% 与 96.4%。

在两个基准与两个 VLA 主干上,StructRL 一致超过所评估的在线 RL 基线,且增益集中在更长时程的任务分桶。 论文在同一 SFT 初始化、同一环境交互预算下与 Sparse-RL、SimpleVLA-RL、PolicyTrim 对比,并额外与学习型稠密奖励基线 Robometer 在同一 PPO 设置下对比。 GR00T-N1.5 上 RoboCasa365 总体成功率 49.1% 对最强在线基线 41.5%(+7.6 点),LIBERO-Long 96.6% 对 92.4%(+4.2 点);π0.5 上分别提升 3.9 与 2.2 点;分桶最大增益为 RoboCasa365 的 1400–2900 步桶 +7.0 点、LIBERO-Long 的 340–400 步桶 +6.6 点。对 Robometer 分别领先 2.4 与 3.2 点。

结构化奖励可与 GRPO 组合,并在更短时程任务上仍有小幅正向效果,同时零样本迁移到未见任务组合的表现仍然有限。 论文检验了奖励形式对优化器的可移植性,以及方法在基线已接近饱和的短任务上的适用边界,并报告了未参与 RL 训练任务上的迁移与遗忘情况。 GRPO 版本在 RoboCasa365 上比 SimpleVLA-RL 高 3.4 点(GR00T-N1.5)与 1.3 点(π0.5),但低于 PPO 版本 4.2 与 2.6 点;LIBERO Spatial/Object/Goal 上平均由 94.7% 升至 95.7%;Composite-Unseen 零样本仅 4.8%(对照 4.3%),Atomic-Seen 为 20.5%(SFT 17.0%、SimpleVLA-RL 16.9%)。

启示与展望

该结果面向已用演示做 SFT 之后的长程操作策略后训练,适用于能提供可二值验证子任务完成信号的模拟环境,例如 RoboCasa365 的厨房复合任务与 LIBERO-Long 的桌面任务;对希望减少奖励工程、又需要稠密监督的 VLA 后训练流程,它给出了一条不依赖 rollout 期奖励模型推理的路径。论文同时报告该奖励形式可与 GRPO 组合,并在 LIBERO Spatial、Object、Goal 等较短任务上保持小幅正向效果,因此其适用范围不限于最长时程场景。

分解由 LLM 生成,论文报告换成较弱的 Qwen3.5-9B 后总体成功率由 49.1% 降至 45.7%,说明分解质量会影响下游 RL 表现;分解密度扫描显示性能在平均子任务数约 5.0 时达到 50.4% 的峰值,而在 52.0 时降至 37.6%,低于仅用终端奖励的 40.2%,论文把这一下降同时归因于更早、任务对齐更弱的完成信号与中间奖励总量增长。奖励节奏依赖演示时长,改用按任务时程均匀分配后成功率由 49.2% 降至 43.1%,更自适应的无演示估计仍是开放问题。伦理声明提到部分 rollout 在拿到中间奖励后空转到超时,且加速子任务完成在真实机器人部署前需要单独的安全验证。零样本迁移到未见任务组合的成功率仍低(4.8%),真实世界评估与从感知中导出完成信号被列为后续方向。

来源