跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

共享策略理论上可达到任意多策略解的性能,但相时长、相异质性与各相数据量决定实践中该选单策略还是多策略

该工作针对可分解为多个相的非平稳强化学习问题,先证明共享的单策略在理论上可以达到任意多策略解的性能,再提出一种基于瞬态动力学时长与准平稳期时长之比的 regime-based 相分解方法来判断哪种策略更优,并用多个非平稳 RL 问题的数值实验验证四个假设:相时长越长越有利于多策略、相间异质性越大单策略负担越重、多策略需要每个相有足够数据、相间转移动力学因环境而异会影响策略选择。