跳到主要内容
返回时间线
arXiv来源发表:

A2Z GameSpec-Bench 用 100 份长文档 GDD 检验编码智能体:可编译率近 99%,但整体 GDD Fidelity 最高仅 77.0

核心概要

该工作提出 A2Z GameSpec-Bench,用 100 份长文档游戏设计文档(GDD,Small 与 Big 各 50 份,平均 14,085 与 26,297 tokens)把每份 GDD 转成固定的依赖感知契约,再以源码检查、场景回放与自适应试玩三条通道评估编码智能体端到端生成游戏的忠实度,结果显示可编译可运行并不等于忠实实现(如 Claude-Fable-5.1 可验证率 98.7% 而整体 GDD Fidelity 为 77.0),依赖上下文把已记录试玩违规的覆盖从 71.1% 提升到 80.2%,需求级反馈两轮后相对自我修订把 Big GDD 上的整体 GDD Fidelity 提升 10.9%。

AI-generated editorial illustration: A2Z GameSpec-Bench: How Faithfully Can Coding Agents Generate Games from Game Design Specifications?

深度剖析

基准把每份长文档 GDD 转成固定的依赖感知契约,其中规则记录条件、触发事件与预期效果,不变量记录限定范围内的约束,有向边连接一条规则更新了另一条规则前置条件所引用的状态或触发其事件的情形。 既有游戏开发基准多用紧凑规格(表中 GameDevBench 185 tokens、PlaytestArena 131 tokens、GameCraft-Bench 1,547 tokens),且不显式表示需求之间的依赖;该工作用平均 20,191 tokens 的长文档 GDD 并显式建图。 契约在检查任何构建之前构建并冻结,跨智能体与修订轮次保持一致;在 100 份 GDD 上重复构建的引用重叠在 Big 上为 93%(朴素评审为 57%),三次规则生成在可达性一致、依赖边 Jaccard 与角色保持上均不低于 0.999。

评估把源码检查、场景回放与自适应试玩三条通道的判定与证据都绑定到同一批需求上,回放用固定输入策略加自适应帧选择,试玩用 Code-as-Policy 机器人做正常游玩与对抗性测试。 既有基准通常只覆盖其中一两个通道(表中仅 A2Z GameSpec-Bench 在源码、渲染行为与自适应游玩三列同时标记),且回放多按固定间隔采样帧。 在 50 个 Small 游戏的相同录像、视觉评分表与帧数下,自适应帧选择在 60.5% 的偏好比较中胜出、在 50 个游戏中赢下 35 个(固定采样 13 个,2 平);在 86 条依赖关联规则上,第二次正常游玩把判定覆盖从 40.5% 提到 41.0%,对抗性测试提到 48.5%。

可编译可运行与忠实实现之间存在明显落差,且局部通过的规则可能依赖失败的前置规则。 把“能跑起来”与“按设计跑对”区分开,并用依赖图给出可达性代理指标。 Claude-Fable-5.1 在编译与运行时检查下可验证率 98.7%,整体 GDD Fidelity 为 77.0;在 100 个 GPT-5.6-Sol 游戏中,依赖关联规则的局部源码通过率为 72.4%,要求所有上游规则也通过后为 22.7%;在源码满分规则中只有 76.8% 在试玩中被确认满足,而源码零分规则中有 25.7% 在试玩中被判满足。

依赖上下文能把检查引向枚举式评估漏掉的运行时失败,需求级反馈也能带来可测量的修订增益。 相对只按需求逐条打分的枚举基线,加入依赖边后检查目标与违规覆盖都扩大;相对只看 GDD 与源码的自我修订,三通道反馈提升更大。 在 100 个 GPT-5.6-Sol 初始构建上,依赖上下文把违规覆盖从 398/560(71.1%)提高到 449/560(80.2%),增益 9.1 个百分点,95% 配对游戏自助区间 6.1–13.0,新增 51 条违规分布在 26 个游戏;在 50 个 Big GDD 上,Source + Replay + Playtest 两轮后平均整体 GDD Fidelity 为 74.3,比自我修订的 67.0 高 7.3 分(相对 10.9%)。

启示与展望

该基准面向 2D 单人浏览器游戏(Phaser 4.1、TypeScript、Vite)的端到端生成,输入是 100 份合成 GDD,分为 50 份 Small(平均 14,085 tokens、约 54 条结果需求)与 50 份 Big(平均 26,297 tokens、约 84 条结果需求);每份 GDD 平均指定 69 条结果需求与 32 条不变量,评估使用 20 个回放场景。它适合用来比较不同编码智能体在长文档规格下的忠实度、定位具体需求级偏差,并作为修订反馈的来源;框架把契约与引擎接口分离,因此可扩展到其他运行时,文中用 3 个 Three.js 3D 游戏(Sonic: Cascade Coast、Diablo Cathedral、Rocket League)做了演示。

契约构建与证据判读都依赖生成模型,固定契约与重复判定不能完全消除遗漏或评审偏差;主结果限于合成 GDD 与 2D Phaser 环境,3D 示例只有 3 个游戏,尚不足以说明跨引擎与跨品类的普遍表现。依赖边被定义为“潜在”前置关系,可达性代理指标反映的是可能的阻塞而非已证实的运行时不可达。此外,本证据包为全文,但部分图表与附录细节以摘要形式呈现,若需核对具体数值与逐条判定,仍需查阅原文附录。

来源