RSIGame 用局部探索-诊断-改进加全局最优检查点,把 Qwen3.8-27B 在 Godot 上从 37.07 提到 61.38,超过 GPT-5.5 单次生成的 50.26
核心概要
RSIGame 把自动游戏开发组织成递归自我改进:局部 explore-diagnose-improve 循环广泛探索可执行游戏、诊断并排序问题、基于证据修改,并用不断增长的检查清单累积测试与改进指引;全局循环跟踪整体质量、保留最佳检查点并检测饱和或回退;此外把成功的开发经验通过监督微调内化进生成器,在 140 个 GameCraft-Bench 任务、Godot 与 Phaser 两个引擎、五个生成器上于同等开发预算下持续提升游戏质量,其中经验内化使 Qwen3.8-27B 在 Godot 达到 61.38、在 Phaser 达到 58.53,超过 GPT-5.5 单次生成分数并把 Qwen 的生成 token 减少 11 倍。
深度剖析
RSIGame 把游戏开发拆成互补的局部与全局两层循环:局部循环由 controller 决定探索方向、explorer 与可执行游戏交互收集行为证据、editor 提出修改、verifier 回放验证是否解决目标问题且未引入回退,并把结果写回不断演化的开发检查清单;全局循环的游戏质量监视器在每个检查点比较保留的冠军版本与候选版本,保留更优者,并在冠军连续三个检查点未被超越时判定饱和。 此前的工作(如 Play2Code、VibeGame、OpenGame)已经引入迭代或验证角色,但论文指出这些系统把迭代本身当作改进来源;RSIGame 的差别在于把迭代组织成有方向、有优先级、有最优检查点保留与饱和停止的受控过程,并明确把监视器与基准评测器隔离,只读单独的代理评分标准。 在 140 个 GameCraft-Bench 任务、Godot 与 Phaser 两个引擎、五个生成器上,RSIGame 在同等开发预算(每轮最多 26 次工具调用、30 轮)下相对冻结初始版本提升约 8.77 至 14.26 个 Overall 分,相对 Play2Code 提升约 1.55 至 13.79 分;Godot 上 GPT-5.5 的 RSIGame 对 Base 为 +14.26(95% CI [11.49, 17.06]),对 Play2Code 为 +13.79(95% CI [10.89, 16.65])。
论文报告全局质量监视器让开发时间扩展更可靠:单纯增加预算并不保证更好游戏,Play2Code 很快进入平台期甚至回退,而 RSIGame 在两个引擎和强弱初始化下都把更多开发轮次转化为更高游戏质量;保留的检查点紧贴每个预算内的 oracle 最优,饱和感知停止用更少轮次达到接近长固定预算的质量。 这把“迭代能改进”与“迭代能持续改进”区分开:论文用图 3 与图 4(a)(b) 说明局部循环单独运行轨迹波动,全局监视器通过保留历史最优稳定过程,并让停止规则本身成为计算效率的一部分。 论文报告保留检查点接近每个预算内的 oracle 最优,饱和感知停止以更少轮次达到与更长固定预算相当的质量;检查点每 3 轮一次,冠军连续 3 个检查点不变即停止。
论文把开发经验内化进生成器:用 GPT-5.5 的生成轨迹、蒸馏出的规划轨迹和 GLM-5.3-Flash 经独立验证的改进轮次,对 Qwen3.8-27B 做 LoRA 监督微调,使模型不只模仿最终游戏,还学习中间的规划、工具使用、诊断与修改决策。 相对只做测试时改进的做法,论文把自我改进从上下文优化扩展到参数优化;消融显示只训练生成轨迹的增益不均衡,加入规划与已验证改进经验后在 Mechanics、Depth、Visuals、Art 四个维度上一致提升,其中 Mechanics 与 Depth 尤其明显,在没有任何测试时开发前 Overall 就提升约 11 分。 训练语料包含 2,213 条生成轨迹、2,108 条规划轨迹和 2,013 个已验证改进轮次(来自 4,003 个候选);微调后 Qwen3.8-27B 单次生成在 Godot 从 37.07 升到 48.22,配合 RSIGame 达到 61.38,超过 Codex GPT-5.5 单次的 50.26,同时生成 token 从 6.41M 降到 0.57M。
论文用独立审计检验局部改进的可靠性:编辑前的证据接地验证把 grounded precision 从 58.6% 提到 72.3%,把每轮无依据目标从 1.93 降到 0.50;编辑后的回放验证在 48 个裁定轮次上检测出 76.2% 的不成功改进,平衡准确率 84.4%,而只检查构建的基线检测率为 0.0%。 论文把验证拆成编辑前与编辑后两个环节,并说明只检查构建能否运行无法发现行为层面的失败;这为“每一轮改进是否真的值得提交”提供了可审计的判据。 审计由 Claude Opus 5 对 40 个 GPT-5.5 初始化游戏的开发轨迹独立裁定,每个案例评两次、分歧人工复核;自由游玩评估中 RSIGame 在 20 个任务上对 Base 为 17 胜 3 负、对 Play2Code 为 18 胜 2 负,与基准排序在 59 个已决比较中一致 45 次。
启示与展望
这项工作面向的是把自然语言规格转成可执行游戏的智能体开发流程,适用于能在实际智能体预算内迭代开发的相对紧凑游戏,并在 Godot 与 Phaser 两个引擎上验证。它使开发团队和研究者可以在同等预算下把更多轮次转化为更高质量,并让较小模型通过经验内化承担更强的生成任务;论文还给出可选的高层指导接口,在自主改进饱和后由人或更强模型提供方向,并报告多阶段开发中后一阶段常被盲评偏好。
论文自述评测集中在 Mechanics、Depth、Visuals、Art 四个维度,未覆盖原创性、叙事质量、长期玩家参与或主观乐趣;高层指导机制只在有限的多阶段案例上评估,何时调用指导、多少指导有益、人与模型指导的差异仍待研究;扩展到更大项目、更长周期与更复杂跨系统依赖仍是开放方向。此外,回放与评分存在任务族相关波动,论文报告 529 个冻结产物三次独立运行的中位极差为 0.73 分,其中 sports、horror、openworld 波动较大,而 racing、rhythm、strategy 的中位极差为零,因此单次比较在波动大的任务族上需要谨慎解读。
