跳到主要内容
返回时间线
arXiv来源发表:

多智能体不再互看奖励:只看同伴行为,也能学会合作并更公平地分收益

导语

多智能体强化学习不再需要读取同伴的私有奖励:每个智能体用自己学到的奖励模型去评估同伴的转移,在 Escape Room、Clean Up 和 Commons Harvest 三个序贯社会困境中都能学出合作,且常比能看到真实奖励的智能体分得更均。

Source-provided article image: Self-Referenced Social Preferences: Cooperation without Observing Others Rewards
Figure 2 · arXiv

正文

智能体可以只靠观察同伴的行为和结果来评估对方处境,不必读取对方的私有奖励信号,就能在三个序贯社会困境里学出合作。 此前的社会偏好方法要把其他智能体的奖励直接喂进目标函数,而奖励是私有的,在仿真之外很少可得。 在 Escape Room、Clean Up 和 Commons Harvest 三个环境中,最好的自参照学习者在集体收益和 Nash 福利上都超过普通 PPO,并在 Escape Room 与 Clean Up 中追平能看到真实奖励的学习者。

每个智能体先在自己的转移上拟合一个自身奖励模型,再把这个模型套到同伴的转移上,估计对方处境,并把估计值送进原有的社会偏好项。 社会偏好本身保持不变,被替换的只是它原本需要的同伴奖励输入。 估计值有两种用法:Self-Referenced Reward 把它加进学习奖励,Self-Referenced Advantage 用它给策略更新加权;在 Clean Up 中,SRR-IA+V 的 Nash 福利为 270,而使用真实奖励的 TR-EI 只有 70。

估计值放在奖励里还是放在策略更新里,取决于社会偏好类型:比较智能体之间差距的偏好适合放进奖励,纯利他的偏好更适合放进策略更新。 此前没有区分这两种接入位置,社会偏好通常只作为内在奖励加入。 SRR-IA+V 在每个游戏中都是两种方法里更好的一个,而 SRA-IA 在 Escape Room 中始终无法逃出;SRA-EI 则在 Escape Room 和 Commons Harvest 中更好。

接下来

下一步可以检验奖励来源不同的智能体,例如各自因不同事件获得奖励时,自身奖励模型是否仍然够用;也可以把自身模型当作先验,再用同伴行为做逆强化学习式的校正。SRR 不依赖 actor-critic,因此可以把自参照偏好搬到基于值的学习器上。让策略看到过去回合的记录或允许通信,可能把轮流承担成本变成有意的轮换。把前瞻从单窗口改为基于记忆,可能让 SRR 在部分可观测下更稳。

在 Commons Harvest 中,自参照学习者的集体收益落后于使用真实奖励的学习者,且该环境的奖励模型是接在策略特征上的小头,受光束大额惩罚主导。Nash 福利在该环境中需要谨慎解读,因为一个忽略他人的自缩放对照取得了最高福利。部分可观测下,奖励接入配合前瞻会失效,而策略更新接入仍能维持合作。异质估值实验中没有任何学习器按估值分配收益,因此自参照是否会误导本会按估值行动的智能体仍待检验。

来源