Mine Odyssey 用 30 个真实地点重建的 180 项任务评测空间智能体,GPT-6 Astra 成功率 85.6%,最强开源模型仅 23.9%
核心概要
作者构建了 Mine Odyssey:基于 BuildTheEarth 的 30 个真实地点 Minecraft 重建(20 个室外、10 个室内,覆盖五大洲 20 个国家与地区),标注 1,059 个 waypoint 并设计 180 项按顺序访问多目标点的自然语言导航任务,配合可编程动作接口、独立到达校验与沙箱隔离;评测八个前沿模型显示 GPT-6 Astra 成功率 85.6%、Claude Opus 5.5 为 73.9%、最强开源模型 DeepSeek-V4.1-Flash 仅 23.9%,且室内成功率普遍低于室外。
Figure 1: Overview of Mine Odyssey environments and task construction. (a) 30 Minecraft reconstructions and geographic coverage. (b) Task construction with White House and Ueno Park examples: reference locations are mapped to waypoints and ordered into navigation tasks. S denotes the start; numbered markers and dashed lines indicate visit order.
arXiv深度剖析
提出 Mine Odyssey 基准,把真实世界地点的 Minecraft 重建转化为可自动校验的多目标顺序导航任务:30 个地点、180 项任务、每项 2–12 个停靠点,任务由自然语言指令给出访问顺序。 既有基准多局限于家居环境或城市导航等较窄设定,覆盖的空间布局、尺度与通行要求有限;该工作把室外街区、乡村聚落、山地、宫殿、体育场与历史客轮纳入同一测试床,并覆盖五大洲 20 个国家与地区。 地图来自 BuildTheEarth 社区重建;waypoint 经三阶段人工构建(地理参考定位、在重建中匹配、进入世界在可达站立位置创建),并用 Baritone 做初步可达性检查后人工实走验证;到达判定由独立评估器以 1 Hz 采样玩家位置与标注坐标比对,仅下一个必需 waypoint 计分。
给出可编程智能体框架与防作弊沙箱:AgentBridge 提供移动、转视角、物品交互等原生 API,mcapi 与 xdo 通过 Bash 调用,智能体可组合命令、脚本、循环与条件逻辑,并用 observe_after_sec 在执行中观察与打断。 相较固定动作原语的评测,这里把导航执行开放给智能体自写程序,并保留持久工作区以跨决策保留信息;同时屏蔽坐标泄露路径、禁用传送与 Baritone 自动导航,并在 Bubblewrap 沙箱中隔离世界存档、waypoint 文件与评估记录。 默认配置为第一人称、冻结正午与晴天、Adventure 模式、Peaceful 难度,禁用小地图面板与导航提示;每任务限 500 步与六小时,最多三次 claim_done;沙箱支持并行评测与容器内 GPU 渲染。
八个前沿模型的成功率差异显著:GPT-6 Astra 85.6%、Claude Opus 5.5 73.9%、Claude Opus 5 (max) 50.6%、GPT-5.6 Sol 43.9%、Gemini 3.8 Flash 26.7%、DeepSeek-V4.1-Flash 23.9%、Grok 4.6 17.2%、GLM-5.3-Flash 15.6%;八个模型中有五个完成任务不足一半。 结果把“智能体空间智能”的当前水平量化为跨环境、长时程的顺序导航成功率,并显示室内外差距:Astra 对 Opus 5.5 的领先从室外 8.8 个百分点扩大到室内 18.2 个百分点。 每个模型在全部 180 项任务上评测,报告 SR、Checkpoint Coverage、SPL、平均轮数与路径长度;作者指出室内外比较针对布局与路线构成不同的任务子集,并不隔离“室内”这一因素本身。
分析揭示失败模式与效率结构:超过一半的失败尝试连第一个必需目的地都未到达;Opus 5.5 的 CC 86.1% 与 SPL 50.35% 仅比 Astra 低 2.9 与 3.35 个百分点,但 SR 差 11.7 个百分点,说明高中间点覆盖率未必转化为完整任务完成。 把“部分进展”与“完整完成”区分开,并给出局部停滞、路线恢复与局部探索不足的案例证据,补充了单纯成功率排名无法呈现的行为差异。 消融显示 HUD 使 DeepSeek 与 GLM 的 SR 分别提升 6.1 与 4.0 个百分点,路线指引略升 CC 但使 DeepSeek 的 SR 下降 2.8 个百分点,午夜光照使两者各降 1.7 个百分点,降雨使 DeepSeek 与 GLM 分别降 3.9 与 2.2 个百分点;局部停滞统计中 Gemini 有 51.7% 的轮次处于原地停留。
启示与展望
该基准面向需要在陌生三维环境中按顺序访问多个目标点的智能体研究,适用于评测地图使用、路线规划、门与楼梯等局部通行交互以及执行中的计划修正。它服务于在 Minecraft 重建环境中做受控、可自动校验、可并行评测的场景,作者表示任务套件与评测框架将公开发布。对希望比较不同模型在多样真实地点布局下长时程导航表现的读者,这是可直接使用的测试床;对关注物理世界部署的读者,其价值在于把空间智能拆解为可观测的成功率、中间点覆盖与路径效率指标。
消融表格中的具体数值在正文中未完整呈现,读者若需逐条件对比需查阅原文表格。室内外成功率差异来自布局与路线构成不同的任务子集,作者明确说明这并不隔离“室内”这一因素。SPL 的参考路径由 A* 在 0.5 格水平栅格与近似碰撞几何上计算,未建模跳跃、游泳、动态姿态变化与按钮交通,且智能体路径长度由约 1 Hz 的位置采样估计,可能遗漏采样间移动,因此路径效率指标为近似值。成本与输出 token 比较基于报告用量而非直接测量推理算力,且为全任务平均,未固定成功任务集合。
