跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

奖励膨胀:训练中逐步放大奖励可加速强化学习并抑制休眠神经元

该工作提出“奖励膨胀”,即在训练过程中逐步放大奖励幅度,并从理论上说明它引入隐式的近因加权、在策略更新中更重视近期转移,同时通过维持梯度信号抑制休眠神经元、帮助保持可塑性;在 ALE 游戏与 MuJoCo 任务上的实验显示适当程度的奖励膨胀对广泛任务有益,作者还提出自适应变体 Fed,可在线调整膨胀水平,且往往优于固定膨胀。