强化学习后训练视觉-语言-动作模型时,参数更新集中在仅占动作专家14.83%–27.58%的Timestep Modules,且其低秩方向可预测并提升任务成功率
核心概要
该工作系统分析了强化学习(RL)如何重塑基于流匹配的视觉-语言-动作(VLA)模型,发现RL在π0.5与GR00T N1.5/N1.6等模型、LIBERO/ManiSkill/MetaWorld/CALVIN等基准上诱导出高度集中于动作专家Timestep Modules的低秩参数更新,这些模块以14.83%–27.58%的参数占比承载了不成比例的RL性能增益,其shift向量更新方向能以最高99.6%的ROC-AUC预测任务成功,且沿该方向引导可在不额外RL训练的情况下进一步提升策略表现。
深度剖析
RL对VLA的更新高度集中在Timestep Modules,且呈现显著低秩结构。 此前对VLA RL的参数空间理解基本空白,而LLM RL已有稀疏更新与低秩方向的研究;该工作首次将这一视角系统扩展到基于流匹配的VLA动作专家,并指出被标准LoRA配置忽略的Timestep Modules是主导更新位置。 在π0.5、GR00T N1.5/N1.6、SmolVLA及LIBERO、ManiSkill、MetaWorld、CALVIN上分析更新密度与有效秩,RL下Timestep Modules更新有效秩仅约1–4,比BC低约一个数量级;图像/视频DiT的RL训练未出现同样低秩结构。
Timestep Modules承载了不成比例的RL性能增益。 通过模块替换实验,将注意力与FFN参数换回基座、仅保留RL训练的Timestep Modules,仍能保留大部分RL增益,而反向替换则明显下降;针对Timestep Modules的LoRA比标准LoRA收敛更快、成功率更高。 在π0.5、GR00T N1.5/N1.6上做受控模块替换,Timestep Modules仅占动作专家参数的14.83%–27.58%;仅用前四个奇异方向重建更新即可保留大部分性能,移除这些方向则性能大幅下降。
RL将Timestep Modules特化到rollout中使用的离散去噪时间步,且shift向量变化最显著并编码任务结果信息。 标准BC在连续时间步上训练,响应平滑;RL与离散时间步BC均产生局部化响应与低秩更新,说明离散时间步训练是低秩结构的主因。在scale、shift、gate三个输出中,shift向量的RL变化方向与基座方向对齐度最低,即引入新方向最多。 对AdaRMS更新做SVD并测量与各时间步条件向量的余弦相似度;用shift更新方向作为探针,在LIBERO-Spatial、LIBERO-Object、LIBERO-Goal、ManiSkill上ROC-AUC达96.6%–99.6%,单方向也可达较高水平,且随机标签对照明显更低。
shift更新的几何结构反映任务关系,并可被用于推理时引导以提升已训练策略。 shift更新方向的成对相似度与跨任务迁移模式正相关,提供了一种紧凑的任务关系表示;沿shift更新方向自适应引导可在不额外RL训练的情况下提升最终RL策略,且优于同范数随机方向。 在LIBERO-Spatial十个任务上训练单任务RL策略,shift更新对齐与迁移效应的平均任务级Spearman相关为正(范围含负值);在五个基准上引导使成功率提升约1.3–3.3个百分点,例如LIBERO-Spatial从86.7%到90.0%、LIBERO-Goal从90.7%到94.7%。
启示与展望
该结果面向基于流匹配动作专家的VLA模型,在仿真基准(LIBERO、ManiSkill、MetaWorld、CALVIN)与π0.5、GR00T N1.5/N1.6、SmolVLA等检查点上验证,主要使用PPO(SmolVLA用GRPO)。它适用于希望以更少参数完成RL后训练、或通过Timestep Modules与shift方向进行轻量适配与推理时引导的研究者与工程团队;离散时间步BC与残差RL设计是文中指出的后续方向。
低秩结构在图像/视频DiT的RL训练中并不一致出现,说明其是否专属于动作策略仍需更多架构验证;探针与引导在LIBERO-Goal、MetaWorld等基准上的AUC与增益波动较大,shift方向符号在不同子层–时间步对间并不一致;跨任务迁移相关性的范围包含负值,任务关系表示的稳健性有待扩展;此外,离散时间步BC与连续时间步BC的取舍、以及引导系数的选择仍需在更多真实机器人场景中检验。
