GGSD 用 1v1 自博弈把五个按键变成可玩技能:人类在 Ant、Franka、G1 上零训练通关 Maze 与 CubePush
核心概要
该工作提出 Game-Guided Skill Discovery(GGSD),在 1v1 竞争游戏中让分层智能体与历史策略池自博弈,高层策略从 5 个(G1 为 6 个)离散技能中选择、低层技能条件策略输出电机动作,并用互信息奖励区分技能语义;训练后人类可直接用同一组离散技能替换高层策略,在 Ant、Franka 机械臂与 Unitree G1 上组合出未训练过的 Maze 与 CubePush 任务,人类评测平均成功率至少 84%。
深度剖析
GGSD 把技能发现的目标从“状态分布可区分”改为“在竞争中能赢”,用简单 1v1 游戏规则作为轻量引导,自博弈中与历史检查点池对抗,从而在高自由度本体上得到语义清晰、可解释的技能。 既有无监督技能发现多依赖互信息或 Wasserstein 依赖度量,只保证技能彼此可区分;语言描述、示范或参考动作等引导方式在高维状态空间或数据准备上代价更高。GGSD 用几行游戏规则替代这些引导,让行为结构由“为获胜所需”自然产生。 论文在 AntSumo、AntFencing、FrankaAirHockey、G1Boxing 四个游戏上训练,每个游戏 4096 个并行环境、70k 次更新;定性可视化显示 Ant 学到转向、移动、推挤,G1 学到移动、出拳与护头防守等行为,且跨随机种子反复出现移动与击打等关键行为。
少量离散技能通过状态依赖的技能切换产生“连招”,在不增加人类输入的前提下扩展表达力。 单个技能在孤立执行时可能只是静态或单一动作,例如 Franka 各技能只把末端移到桌面某区域后停住;但技能之间的切换能生成快速且有目的的击球动作,G1 中从技能 5 切到技能 2 产生后仰、反向切换产生强力前冲拳。 论文以固定技能连续执行 5 秒的快照叠加做可视化,并在附录中把该现象解释为状态空间被划分为少量行为“区域”,区域内技能语义保持可预测;作者同时指出区域过多会让同一按键含义过多、界面难以理解。
用视觉语言模型度量技能语义多样性时,GGSD 在全部本体上高于 DIAYN、DADS、METRA 等基线。 该指标把技能 rollout 视频交给 VLM 生成自然语言描述,再用文本嵌入计算两两距离,并对“无语义”片段赋零距离,因此衡量的是语义差异而非单纯动作差异。 论文报告 GGSD 在 Ant 与 G1 上约比最强基线高出一档、在 Franka 上高 28%,结果为三个随机种子的平均;基线 METRA 使用 5 维连续技能并以 one-hot 基向量对应五个技能。
游戏中学到的低层技能可被人类直接复用,在训练分布之外的任务上无需额外策略训练即可完成。 训练游戏是推挤、击剑、空气曲棍球与拳击,而评测任务是 Maze 导航与 CubePush 物体推动,且训练在 Isaac Lab、评测在 MuJoCo web,存在任务与模拟器双重迁移。 人类评测 5 名参与者(含 2 名作者)每任务 5 次试验,AntMaze 成功率 100%、平均 82.7 秒,AntCube 100%、62.2 秒,G1Maze 84%、22.0 秒;另有 4 名用户在 AntSumo 上各与最终 70k 检查点对战 5 局,人类仅赢 2 局。
启示与展望
该结果面向希望用少量离散输入直接操控高自由度具身智能体的研究者与交互设计者,适用场景是技能集由简单 1v1 竞争游戏塑造、且下游任务所需行为落在游戏所要求的行为范围内。它使人类无需训练新控制器即可组合技能完成 Maze 与 CubePush 这类未见过任务,也为把游戏规则当作技能发现引导信号提供了可复用的训练流程;作者把扩展到需要更广动作能力的游戏视为获得更通用技能库的重要方向。
人类评测规模为 5 名参与者、每任务 5 次试验,且其中包含作者,因此成功率与完成时间反映的是小样本下的可玩性;技能语义一致性只在少量状态区域假设下成立,区域数量与界面可解释性之间的权衡仍是开放问题;技能库受游戏所需行为约束,游戏未要求的灵巧操作等能力能否出现尚无证据;此外,VLM 语义多样性指标依赖特定模型与提示词,其在不同模型下的稳定性值得继续观察。
