奖励膨胀:训练中逐步放大奖励可加速强化学习并抑制休眠神经元
相关研究与后续进展核心概要
该工作提出“奖励膨胀”,即在训练过程中逐步放大奖励幅度,并从理论上说明它引入隐式的近因加权、在策略更新中更重视近期转移,同时通过维持梯度信号抑制休眠神经元、帮助保持可塑性;在 ALE 游戏与 MuJoCo 任务上的实验显示适当程度的奖励膨胀对广泛任务有益,作者还提出自适应变体 Fed,可在线调整膨胀水平,且往往优于固定膨胀。
Figure 1: (a) The nominal and real performance growth over training time under 2 % 2\% inflation. (b) The inflation rate and inflation level I ( g ) I(g) over the training time. (c) The TD error w.r.t. the transition age in replay buffer, across the inflation rates. (d) The changes of gradient norms during training.
arXiv深度剖析
提出奖励膨胀这一机制:在训练过程中对奖励进行逐步缩放,而非像通常做法那样把奖励幅度在训练全程保持固定。 以往工作多把奖励幅度视为固定量,奖励的时间调制相对未被充分探索;该工作把奖励随训练进程的渐进放大作为一个独立可调的训练信号维度提出。 摘要层面给出机制定义与理论论证,并在 ALE 游戏和 MuJoCo 任务上报告经验结果,说明适当程度的膨胀对广泛任务有益;具体实验规模与数值未在摘要中给出。
理论分析表明奖励膨胀会诱导隐式的近因加权,使策略更新时更重视近期转移,从而更快适应。 这为“放大奖励”提供了机制性解释:其作用不只是整体缩放信号强度,而是改变了不同时间转移在策略更新中的相对权重。 属于理论推导层面的论证,摘要陈述了该结论;摘要未提供推导细节或假设条件。
奖励膨胀通过维持梯度信号、缓解策略饱和,抑制休眠神经元的出现并帮助保持可塑性。 把奖励的时间调制与可塑性保持、休眠神经元这两个训练动力学现象联系起来,给出了奖励缩放影响网络内部状态的一条路径。 摘要给出理论说明,并以 ALE 与 MuJoCo 上的经验结果相互印证;摘要未报告休眠神经元比例等具体量化指标。
提出自适应变体 Fed,可在线调整膨胀水平,并发现它往往优于固定膨胀。 从固定膨胀扩展到随训练动态自适应调整膨胀程度,减少了人工设定膨胀水平的需要。 摘要报告 Fed“often improves upon fixed inflation”,属于经验性比较结论;摘要未给出比较的具体任务、基线或统计细节。
启示与展望
该工作面向强化学习训练过程,适用于以奖励为主要学习信号的设置,并在 ALE 游戏与 MuJoCo 任务上给出经验支持;其结论针对“适当程度”的奖励膨胀,即膨胀水平需要落在合适范围内。对希望改善策略适应速度、缓解策略饱和与休眠神经元、并保持网络可塑性的研究者与工程实践者,这一机制提供了一条在训练过程中调制奖励幅度的思路;Fed 进一步面向不愿手工设定固定膨胀水平的场景,尝试在线调整。
摘要未给出理论推导的假设与适用范围,也未报告实验的任务数量、基线、膨胀水平取值与统计显著性,因此“适当程度”的具体界定、Fed 相对固定膨胀的改进幅度,以及结论在不同算法与任务分布上的稳健性,仍是需要阅读正文确认的开放问题。此外,本次仅基于摘要进行总结,未读取正文、图表与附录,故无法评估实现细节与消融结果。
