跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

VIGOR 用潜空间一致性让基于模型的强化学习在未见视觉干扰下零样本泛化,在 DMC 与 Robosuite 上分别超出次优基线 3.4% 与 43.6%

作者提出 VIGOR 框架,通过非对称弱到强增强、动力学层一致性(直接潜回归约束增强不变的转移预测)与编码器层稳定化三个相互依赖的组件,在保留基于模型强化学习样本效率的同时实现对未见视觉干扰的零样本泛化,在 DeepMind Control Suite 与 Robosuite 上超过当前最优的无模型与有模型基线,分别比次优基线高 3.4% 与 43.6%,消融显示更换不同扰动族的增强方式仍保持强泛化,说明驱动鲁棒性的是潜空间一致性而非增强选择。