跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

用基础模型做评论家骨干,随机接入网络的多智能体强化学习收敛提速至少55%

该工作提出一种基础模型辅助的全去中心化多智能体强化学习框架:以自监督前向动力学预训练的基础模型作为评论家网络的奖励无关骨干,设备仅通过局部共识交换标量奖励,在公平AoI、最大和速率与公平速率三个随机接入优化任务上给出有限时间收敛分析,并报告收敛速度相对端到端训练提升至少约55%。