跳到主要内容
返回时间线
MIT News - Artificial intelligence来源发表:

MIT等团队开发的Ataraxos在Stratego上以15-1-4击败世界最强人类选手,训练成本不到DeepNash的百分之一

核心概要

MIT、卡内基梅隆大学、纽约大学和斯坦福大学的研究者开发了名为Ataraxos的AI系统,它结合自对弈强化学习得到的“蓝图策略”与使用生成模型进行决策时规划的方法,在隐藏信息的棋盘战争游戏Stratego中以15-1-4的创纪录比分击败世界最强人类选手,并在世界锦标赛顶级选手中取得39-2的战绩,同时训练样本不到DeepMind的DeepNash的百分之一、自对弈局数不到其三十分之一,还能泛化到Barrage Stratego、Hanabi和斗地主等不同规则的不完全信息游戏。

AI-generated editorial illustration: This game-playing AI is the new champ at Stratego

深度剖析

Ataraxos在Stratego上达到超人类水平:以15-1-4的创纪录比分击败世界最强选手,并在世界锦标赛顶级人类选手中取得39-2的战绩。 此前包括DeepMind在内的系统即便投入数百万美元训练成本,也未能击败顶级人类Stratego选手,因此这是首个在该基准上战胜顶尖人类玩家的AI系统。 文中给出了具体对局比分(15-1-4与39-2),对手为世界最强选手和世界锦标赛顶级选手;Stratego的可能棋子配置超过10的66次方,远多于国际象棋,说明该任务难度很高。

该系统在训练效率上大幅超越此前的DeepNash:达到更高的对局强度,却使用不到百分之一的训练样本和不到三十分之一的自对弈局数。 以往方法依赖计算代价高昂的复杂运算,而Ataraxos通过高效算法避免了穷举所有可能走法,从而显著降低训练成本。 效率对比来自作者Farina的直接陈述,给出了“不到百分之一”和“不到三十分之一”的量化比例,但文中未列出绝对训练量或硬件细节。

方法的关键在于把自对弈强化学习得到的蓝图策略与决策时规划结合,后者用生成模型按概率估计对手隐藏棋子的身份,再评估后续选择。 作者称这一生成模型用于决策时规划的创新是让Ataraxos达到超人类水平的关键缺失环节,使其不必盲目猜测,而是聚焦于当前具体棋盘与对手。 文中以作者访谈形式说明该机制是性能突破的关键,并解释了其作用方式,但未给出消融实验或组件贡献的定量分解。

该方法具有泛化性:研究者将Ataraxos适配到Barrage Stratego、Hanabi和斗地主等规则与设计不同的不完全信息游戏,并在每个游戏中都达到超人类表现。 这表明该方案不是针对Stratego的专用解法,而是可迁移到合作型、多人及不同规则的不完全信息博弈。 文中列举了三个具体游戏并称在每个实例中都达到超人类表现,但未给出这些游戏中的具体比分或对手水平细节。

启示与展望

该结果适用于隐藏信息、无法穷举所有可能性的决策场景,作者明确将其定位为可迁移到商业谈判、网络安全乃至军事机动等现实问题的算法基础。对研究者而言,它提供了一个在Stratego这类基准上训练成本远低于以往方法的系统;对希望把AI用于不完全信息决策的实践者而言,它说明通用型算法在此类任务上可以表现良好。作者也指出,若要真正被采纳,还需要让人类能够审计模型决策,因此他们下一步计划为Ataraxos加入可解释性度量,使系统能以人类可理解的方式解释其决策。

读者仍需留意:文中未给出训练所用的绝对样本量、算力或硬件配置,效率对比以相对比例呈现;生成模型用于决策时规划的关键作用来自作者陈述,缺少消融实验的定量支撑;在Barrage Stratego、Hanabi和斗地主中的超人类表现未附具体比分或对手水平;从棋类博弈到商业谈判、网络安全等现实场景的迁移目前仍是作者的展望,尚未有实证。此外,本文为面向公众的报道,未包含论文中的图表与实验细节,因此对方法内部机制的描述以作者访谈为主。

来源