跳到主要内容
返回时间线
arXiv来源发表:

Kaggle Game Arena 用国际象棋、扑克与狼人杀对打十款前沿模型:Gemini 3 系列在国际象棋与狼人杀领先,GPT-5.2 在扑克以 +46.6 BB/100 居首,且各游戏排名互不一致

核心概要

该技术报告推出 Kaggle Game Arena 这一开放式对战评测平台,用统一文本接口让十款前沿模型在国际象棋、扑克与狼人杀中进行大规模循环赛(扑克共 90 万手、每模型 18 万手),以胜负、筹码与角色分解等客观结果而非主观打分排名,并报告各游戏内模型实力分层明显但跨游戏排名并不一致。

AI-generated editorial illustration: Game Arena: Strategic LLM Evaluation in Competitive Environments

深度剖析

平台把评测从静态题库搬到动态对战:模型在结构化环境中两两对局,随着模型变强对局强度自然上升,从而避免性能饱和,并用胜负、筹码量等客观结果而非人类或模型评委打分来排名。 相较 MMLU、GSM8K、HellaSwag 等固定测试集以及 Chatbot Arena、MT-bench 这类偏好式评测,该工作以真实对局结果作为锚点,规避饱和、数据污染与评委主观性。 论文给出统一文本 harness、非法动作重试机制、方差削减与自助法置信区间,并公开 harness 与完整对局轨迹数据集。

国际象棋中模型实力分层清晰:Gemini 3 Pro Preview(内部 Elo 1325)与 Gemini 3 Flash Preview(1297)居首,o3(1009)与 GPT-5.2(933)次之,Claude 4.5 系列垫底(Opus 236、Sonnet 189、Haiku 122)。 借助 Stockfish 逐局面胜率路径分析,论文把差距定位在中局与残局而非开局,并发现弱模型随对局推进非法着法(rethink)显著增多。 每对模型下 40 局并保持黑白各 20 局平衡,另设 20 个 Lichess 热门两回合开局的 Chess Opening 变体作为稳健性检验,排名与 Chess Text 基本一致。

扑克中 GPT-5.2 以 +46.6 BB/100 明显领先,o3(+29.7)与 Grok 4(+27.1)次之,GPT-5 mini(-94.9)为明显离群;翻前风格差异巨大,但翻前激进度与盈利率并非线性关系。 论文首次在 LLM 扑克评测中采用重复扑克(手牌镜像)格式,并让模型在 100 手一集的完整文本历史中显式进行对手建模,每手结束后双方底牌公开。 每对局 2 万手、十模型循环赛共 90 万手(每模型 18 万手),采用分块自助法置信区间;GPT-5.2 与 o3 及中下游模型的 95% 区间不重叠。

狼人杀中 Gemini 3 Pro Preview 与 Gemini 3 Flash Preview 净评分最高且在各角色上贡献均衡,GPT-5 mini 在所有角色上均为严重负贡献;替换分析显示 Gemini 3 Pro Preview 在任何角色、任何替代对象下都是改进。 论文用博弈论评估(GTE)把整体技能分解为狼人、预言家、医生、村民的角色专属贡献,避免传统 Elo/OpenSkill 把个人技能与随机角色基础胜率混为一谈。 通过自对弈 500 局逐项消融规则,把村民胜率从标准规则的 73.4% 压到 56.7%,并报告自助法置信区间与锦标赛图的无环传递性检验。

启示与展望

该工作面向需要持续、可复现地比较前沿模型策略能力的评测者与模型开发者,适用于国际象棋(完全信息)、扑克(不完全信息、双人零和)与狼人杀(多人、非零和、信息不对称)三类结构化环境,并公开 harness 与完整对局轨迹数据集供下游研究复用。其设计意图是让新游戏、变体与评测方法可以持续加入而不使既有结果失效,从而支持纵向测量与基准设计本身的研究。

论文自述的开放方向包括:当前每对模型固定局数,未按不确定性自适应分配算力;模型频繁更替会打断纵向比较与对局图连通性;各游戏使用不同主指标,尚缺跨游戏的统一元评分;多人博弈中的公平信用分配与团队结果聚合仍是开放问题。此外,狼人杀的规则平衡以单一高能力模型自对弈 500 局作为经验代理,而非精确纳什均衡;国际象棋的 Stockfish 外部校准在引擎校准范围之外可靠性下降;狼人杀的启发式指标(KSR、IRP、VSS 等)区分度不足,论文因此以 GTE 为准。读者在引用具体排名时,宜结合各游戏报告的置信区间与上述适用范围一并理解。

来源