跳到主要内容
返回时间线
arXiv来源发表:

VIGOR 用潜空间一致性让基于模型的强化学习在未见视觉干扰下零样本泛化,在 DMC 与 Robosuite 上分别超出次优基线 3.4% 与 43.6%

相关研究与后续进展

核心概要

作者提出 VIGOR 框架,通过非对称弱到强增强、动力学层一致性(直接潜回归约束增强不变的转移预测)与编码器层稳定化三个相互依赖的组件,在保留基于模型强化学习样本效率的同时实现对未见视觉干扰的零样本泛化,在 DeepMind Control Suite 与 Robosuite 上超过当前最优的无模型与有模型基线,分别比次优基线高 3.4% 与 43.6%,消融显示更换不同扰动族的增强方式仍保持强泛化,说明驱动鲁棒性的是潜空间一致性而非增强选择。

Source-provided article image: VIGOR: Zero-Shot Visual Generalization via Latent-Space Consistency in Model-Based Reinforcement Learning
Figure 1 ·

Figure 1: Challenges of unseen visual distractions. Left: During training (top), clean observations s t train s_{t}^{\text{train}} are encoded into in-distribution latents z t ∈ 𝒵 train z_{t}\in\mathcal{Z}^{\text{train}} , where the dynamics model d θ d_{\theta} produces accurate transitions. At test time (bottom), visual distractions yield out-of-distribution latents z t ′ ∉ 𝒵 train z^{\prime}_{t}\notin\mathcal{Z}^{\text{train}} , causing erroneous transitions. Right: These deviations compound over horizon H H , leading to divergent rollouts and planning failures. The proposed VIGOR framework targets this failure mode by aligning perturbed rollouts ( z t ′ , z t + 1 ′ , … , z t + H ′ ) (z^{\prime}_{t},z^{\prime}_{t+1},\dots,z^{\prime}_{t+H}) with their in-distribution counterparts ( z t , z t + 1 , … , z t + H ) (z_{t},z_{t+1},\dots,z_{t+H}) , anchoring predictions to the task-relevant manifold 𝒵 train \mathcal{Z}^{\text{train}} (mechanism described in Section 3 ).

arXiv

深度剖析

论文指出基于模型的强化学习存在“两级脆弱性”:视觉干扰先把编码器输出推出分布,这些误差再在规划时域内的递归潜空间 rollout 中累积,这与无模型强化学习中编码器扰动只影响单步预测不同。 把视觉泛化问题从单步编码器鲁棒性重新定位为潜空间动力学在递归规划下的误差累积问题,为方法设计提供了新的问题刻画。 该论断以对无模型与基于模型两类方法的机制对比形式给出,属于论文的问题动机陈述,摘要中未给出量化验证。

VIGOR 整合三个相互依赖的组件:非对称弱到强增强(在同一批次内配对仅弱增强与弱到强增强的潜视图)、动力学层一致性(通过直接潜回归强制增强不变的转移预测)、以及编码器层稳定化(防止在动力学层一致性施加的跨增强监督下编码器漂移)。 将增强不变性约束从编码器输出层下移到潜动力学转移预测层,并配套引入编码器稳定化以抵消该跨增强监督带来的漂移,形成三者耦合的设计。 摘要以组件化方式描述方法构成,未给出各组件的独立消融数值;组件必要性由“相互依赖”的表述支撑。

在 DeepMind Control Suite 与 Robosuite 上的评测显示 VIGOR 优于当前最优的无模型与有模型基线,分别比次优基线高 3.4% 与 43.6%。 在保留 MBRL 骨干样本效率的前提下取得零样本视觉泛化优势,且提升幅度在两个基准上差异明显。 摘要报告了两个基准上的相对提升数值,但未给出绝对回报、随机种子数、置信区间或统计检验信息。

消融显示 VIGOR 的鲁棒性与增强方式无关:把默认增强替换为来自不同扰动族的替代方案后仍保持强泛化,说明驱动鲁棒性的是潜空间一致性而非增强选择。 把方法有效性的归因从具体增强策略转移到潜空间一致性机制本身,降低了对特定增强设计的依赖。 摘要以消融结论形式陈述,未列出所替换的具体增强族、消融数量或对应性能数值。

启示与展望

该工作面向在已学习潜动力学内做规划的基于模型强化学习,适用于训练时未见过的背景变化、光照变化或相机位移等视觉干扰场景,目标是在保留 MBRL 样本效率的同时获得零样本泛化能力。其验证范围是 DeepMind Control Suite 与 Robosuite 两个基准,并与当前最优的无模型与有模型基线比较。对读者而言,这意味着若你的系统属于潜空间规划类 MBRL 且部署环境存在视觉分布偏移,VIGOR 的组件划分(增强配对、动力学层一致性、编码器稳定化)可作为可直接借鉴的设计模板;消融显示的增强无关性也提示工程实现时不必绑定特定增强算子。

摘要未给出绝对回报数值、随机种子数量、置信区间或显著性检验,因此 3.4% 与 43.6% 的相对提升在不同基准上的可比性仍需结合正文表格判断。消融部分只说明替换为不同扰动族的增强后仍保持强泛化,未列出具体增强族与对应性能,增强无关性的边界条件有待正文确认。此外,评测限于 DMC 与 Robosuite 两个仿真基准,真实机器人视觉干扰下的表现、以及三个组件各自的独立贡献与相互依赖程度,都是读者可继续关注的方向。

来源