跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

PlaySuite 用 5,734 款开源游戏评测 14 个开放模型,发现感知与行动之间存在明显落差

该工作构建了 PlaySuite 基准,从 PyWeek 与 itch.io 筛选出 5,734 款开源游戏,配套统一的闭环交互框架、面向 HPC 集群的批量执行与 Video-LLM-as-a-judge 里程碑评分协议,并在 5,630 款 itch.io 与 104 款 PyWeek 游戏上评测 14 个开放权重模型(VLM、CUA、VLA),结果显示模型仅在少数游戏上取得有意义进展,无历史条件下 Qwen3-Omni 在 itch.io 与 PyWeek 的平均进度分最高(0.84 与 1.26),至少达到 Partial 的比例分别为 19.5% 与 37.0%,并伴随空间定位、动作执行与自我纠正等反复出现的失败。