GRID 从异质示范者群体中分解出通用奖励,实现通用预训练并超越标准示范学习基线
相关研究与后续进展核心概要
该工作提出通用奖励推断与解耦方法 GRID,通过信息瓶颈把每个智能体的奖励函数分解为所有智能体共享的通用奖励与体现个体偏好的特定奖励,仅用通用奖励训练即可得到内化安全与基本任务能力等通用环境胜任力的通用智能体,并在合成基函数分解、多智能体 Craftax、MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器实验中成功以语义有意义的方式解耦奖励结构、优于标准示范学习基线,并支持更高效稳定的下游任务专门化。
Figure 2: The model architecture of GRID. The summed outputs of the general and specific reward models yield the total reward. ℒ compression \mathcal{L}_{\text{compression}} and ℒ identity \mathcal{L}_{\text{identity}} form the information bottleneck while ℒ reconstruction \mathcal{L}_{\text{reconstruction}} helps predict the total reward. Losses are jointly optimized.
arXiv深度剖析
GRID 将每个示范智能体的奖励函数分解为通用奖励与特定奖励两部分,通用奖励刻画所有智能体共享的行为,特定奖励刻画个体偏好与目标。 以往从示范中学习通常把异质群体的行为信号混在一起处理,而该工作把奖励结构显式拆分为共享与个体两层,从而在异质群体中区分出哪些行为值得模仿。 摘要说明分解通过信息瓶颈实现,并在合成基函数分解实验中验证了奖励结构被以语义有意义的方式解耦。
仅以通用奖励进行训练构成一种通用预训练范式,得到的通用智能体内化安全与基本任务能力等通用环境胜任力,且不出现标准示范学习中的模式平均偏差。 这提出了一条不同于直接模仿异质示范的预训练路径:先抽取跨智能体共享的通用行为,再用于下游适配,而非在冲突信号上做平均。 摘要以模式平均偏差作为对照,说明标准示范学习技术受此影响,而通用奖励训练可避免该问题。
该通用智能体可作为下游任务微调的强先验,支持包括训练中未出现过的偏好在内的专门化,并使专门化更高效、更稳定。 通用预训练产物被定位为可迁移的先验,而非仅服务于训练时已见目标的策略,从而把通用行为学习与后续个性化适配衔接起来。 摘要报告在 MuJoCo Gym 连续控制与 Highway-Env 自动驾驶模拟器上,GRID 优于标准示范学习基线并带来更高效稳定的专门化。
GRID 在合成基函数分解、多智能体 Craftax、连续控制与自动驾驶模拟器四类设置中得到验证。 验证覆盖从受控的合成分解到多智能体环境与真实感较强的连续控制、驾驶模拟,说明方法不局限于单一任务形态。 摘要列出上述四类实验设置,并称其确认了奖励结构解耦、基线超越与专门化效率稳定性。
启示与展望
该工作面向从异质示范者群体中提取通用行为的设定,适用于存在多个目标不同示范者、且希望获得可迁移通用先验的场景,例如多智能体环境、连续控制与自动驾驶模拟。其通用智能体被定位为下游任务微调的强先验,因此直接受益者是需要在异质示范基础上做专门化的研究者与工程实践者。摘要所述验证覆盖合成基函数分解、多智能体 Craftax、MuJoCo Gym 与 Highway-Env,说明结论主要在这些实验条件下成立。
摘要层面未给出各实验的具体指标、样本规模与统计显著性,因此通用奖励训练相对基线的优势幅度尚不清楚。信息瓶颈的具体形式、通用与特定奖励的划分准则,以及模式平均偏差的度量方式,均需在正文中确认。通用智能体对训练中未出现偏好的适配效果,摘要仅作概括性陈述,其稳健性与适用范围仍是值得关注的开放问题。此外,本次读取为摘要范围,未包含图表与附录,上述判断可能随完整内容而变化。
