PlaySuite 用 5,734 款开源游戏评测 14 个开放模型,发现感知与行动之间存在明显落差
相关研究与后续进展核心概要
该工作构建了 PlaySuite 基准,从 PyWeek 与 itch.io 筛选出 5,734 款开源游戏,配套统一的闭环交互框架、面向 HPC 集群的批量执行与 Video-LLM-as-a-judge 里程碑评分协议,并在 5,630 款 itch.io 与 104 款 PyWeek 游戏上评测 14 个开放权重模型(VLM、CUA、VLA),结果显示模型仅在少数游戏上取得有意义进展,无历史条件下 Qwen3-Omni 在 itch.io 与 PyWeek 的平均进度分最高(0.84 与 1.26),至少达到 Partial 的比例分别为 19.5% 与 37.0%,并伴随空间定位、动作执行与自我纠正等反复出现的失败。
Figure 2 : Examples from the PlaySuite game corpus. PlaySuite contains a broad collection of independently developed games with varied visual styles, mechanics, camera perspectives, and controls. These examples illustrate the range of settings agents must handle, from 2D platform and puzzle games to racing, exploration, shooting, and 3D navigation environments.
arXiv深度剖析
构建了规模远超既有游戏基准的交互式视觉智能评测集:5,734 款来自 PyWeek 与 itch.io 的开源游戏,覆盖 Pygame、HTML5、Godot、Unity 等引擎与九大类型,且这些独立游戏对当前模型大体处于分布外。 既有游戏基准多限于个位数到二十余款游戏(如 Balrog 6 款、Orak 12 款、VideoGameBench 23 款),PlaySuite 在游戏数量上高出两个数量级,并同时覆盖 VLM、CUA、VLA 三类模型。 论文给出从约 1,460 款 PyWeek 与 1.7M 款 itch.io 初始池经评分门槛、平台兼容性、安全分级与运行验证筛选到 5,734 款的完整流程,并说明最终评测使用 5,630 款 itch.io 与 104 款 PyWeek 游戏。
提出无需环境专属奖励的里程碑式 Video-LLM-as-a-judge 评分协议,将可观察的游戏事件映射为 None 到 Completed 五级进度。 以往多游戏评测依赖逐游戏工程化改造与手工奖励,该协议用固定规则把分数提升、进入新区域、完成中间目标、通关等事件映射为统一进度等级,从而支持跨数千款异构游戏的比较。 以 Qwen3.5-9B 为默认裁判,在 60 段游戏视频(45 段 itch.io、15 段 PyWeek)上与六名人类标注者比对:人类之间在一级以内一致率为 93.0%,裁判与人类为 90.4%;Qwen3.5-27B 为 91.6%,Gemma-4-31B-it 与 Molmo2-8B 一致性更低。
给出跨 14 个开放模型的实证结果,显示静态视觉推理与计算机使用能力并不能可靠迁移到游戏中的目标导向交互。 此前的能力展示多集中在少数环境,该工作在同一协议下横向比较 VLM、CUA 与 VLA,并报告模型家族之间没有清晰分层:CUA 与同规模 VLM 相当,VLA 总体落后于最强的 VLM 与 CUA。 无历史条件下 Qwen3-Omni 在 itch.io 与 PyWeek 的平均进度分最高(0.84、1.26),至少 Partial 的比例为 19.5%、37.0%;加入交互历史后 Gemma-4-26B 在两个语料上最高(1.02、1.37)。类型层面 Simulation 与 Strategy 得分最高,Adventure 与 Puzzle 最低。
提供了面向 HPC 的批量闭环执行基础设施,并给出若干控制实验,包括历史长度、提示策略、动作频率与基准规模的影响。 通过共享 vLLM 推理服务与多游戏 worker 并行,把模型加载成本在游戏间摊销;同时用采样实验量化了基准规模与模型排序稳定性之间的关系。 在单张 H100 上用 Qwen3-VL-8B 测试,八个并发 worker 将吞吐从 6.7 提升到 42.4 次评测每 GPU 小时;启动开销从约 90 秒降至 8.3 秒;50 款游戏时模型排序中位秩相关为 0.846,2,000 款时为 0.987,但完整语料前三名集合在 2,000 款样本中仅 45.5% 被复原。
启示与展望
该基准面向零样本推理场景,衡量的是未经微调或强化学习时的开箱泛化能力,适用于希望在同一协议下比较通用交互模型的研究者与工程团队。评测在 5,630 款 itch.io 与 104 款 PyWeek 游戏上进行,交互频率为 itch.io 的 0.33 Hz 与 PyWeek 的 0.33 Hz 和 3 Hz,单局 itch.io 约 300 秒游戏时间、约 100 步交互,PyWeek 上限 10,000 帧。闭环协议在模型推理期间暂停游戏进程,因此结果对应的是决策质量而非实时反应速度。里程碑评分刻画可观察进度,可用于大规模筛选与趋势比较;作者也说明该流水线已验证约 17.5K 个可执行环境,为后续扩充留出空间。
读者仍需留意若干开放问题。裁判与人类在一级以内的一致率为 90.4%,低于人类之间的 93.0%,说明五级进度标签在边界情形上仍有判定空间;不同裁判模型的一致性差异也提示评分对裁判选择有一定敏感性。平均进度分是序数结果的汇总,作者明确说明它不应被理解为游戏完成比例。历史长度增加反而降低平均进度这一趋势与直觉相反,论文指出个别模型仍可从历史中获益,因此历史如何被有效利用仍是待解问题。此外,基准使用公开游戏、源码与元数据,数据污染无法完全排除,纳入新发布的游戏只能降低而非消除该风险。
