NavGPT-3 用 OS 式运行时把语言模型推理与 VLA 执行接成一条可中断的导航回路,在 RxR-CE 上以 90.43 SR 追平人类跟随者
核心概要
NavGPT-3 把语言模型 Planner 与 8B 导航动作策略 NavGPT VLA 通过一个 harness 和 OS 式运行时连接起来:推理、执行与监控作为独立线程运行,运行时按优先级分配运动权限,使机器人可被中断并切换线程;完整系统在 R2R-CE 达到 81.51 SR,在 RxR-CE 以 90.43 SR 与 78.47 nDTW 追平人类跟随者,并把系统最小反应时间从每次语言模型决策 3–19 秒降到每个动作策略步 0.5–1 秒。
Figure 1: Overview of NavGPT-3 : (a) runtime abstraction with the planner, VLA, and spatial tools; (b) synchronous tool use versus asynchronous thread coordination; and (c) benchmark performance. NavGPT-3 reaches human performance on RxR-CE .
arXiv深度剖析
harness 把上下文、空间工具、持久路线状态与执行返回组织成一个可检查、可修正的具身接口:Planner 可调用 observe_map 读取已观测俯视图与按访问顺序编号的节点,用 navigate_to_node 回到任一已访问地点,用 annotate_node 标注地点,并在委托 VLA 执行后依据返回的路线关键帧与执行状态做局部修正,最后显式调用 terminate_episode 结束任务。 与把规划模型与学习控制器分层组合、或仅保留轨迹证据用于问答的既有系统相比,这里把返回证据用于修正一条指令跟随路线本身,并让 VLA 的停止只结束一次委托而非整个 episode。 在固定 100 集 R2R-CE 子集上,仅基础工具时 GPT-6 Astra 为 72 SR、325.0k tokens,Claude Opus 5 为 66 SR、721.0k tokens;加入 Map 与 Backtrack 后分别升至 83 SR 与 73 SR,tokens 下降 41% 与 33%。
OS 式运行时以线程和运动权限协调推理、执行与监控:事件按优先级处理,保护性事件优先级最高,episode 上限优先于常规复查,过期事件不能恢复已作废的操作;权限被撤销后命令携带的版本号失效,恢复运动需要重新感知与新权限。 既有分层系统覆盖图记忆、回溯、验证与恢复,但未把运动权限的授予、撤销与版本检查作为运行时机制来管理异步线程。 在 Unitree Go2 的匹配对比中,重叠推理与优先级监控把 SR 从顺序排队处理的 73.3 提升到 83.3,并把 p95 停止延迟从 1840 ms 降到 180 ms;漏停从 7/30 降到 0/30,被接受的过期命令为 1/30,恢复 SR 为 80.0。
NavGPT VLA 用 codec allocation 按场景变化分配视觉 token:每个视图的首张观测为 I-frame 得满分,后续 P-frame 以相邻缩略图的平均绝对像素差计分,权重同时包含变化、时近性与视角,分配器与 token 总量不变。 相对仅按位置(时近性与视角)分配固定预算的做法,这里让 token 从低变化图像流向变化图像,且训练随机化预算与分配上限以使非平凡历史进入该规则生效的区间。 在 8B 的三个累积训练范围上,codec 分别把 R2R-CE SR 提高 1.7、5.7、2.1 点,把 RxR-CE SR 提高 1.6、2.6、2.6 点;4B 在 RxR-CE 上提高 3.7、0.5、1.4 点,在 R2R-CE 上前两个范围变化在 1 点以内,加入跨具身数据后同时改善 SR 与 SPL。
数据规模比模型规模贡献更大:混合数据从 1.70M 条 VLN 记录扩到完整的约 19.28M 条,使 4B 的 R2R-CE SR 从 62.6 升到 72.54、8B 从 65.3 升到 74.51,RxR-CE 分别从 68.7 升到 76.77、从 70.5 升到 78.19;8B 在每个范围领先 4B 2.0 到 4.3 点。 该混合数据按能力、具身与观测接口、条件与边缘情形、视觉语言理解四条轴组织,把 83 个来源统一到同一八路点动作空间,其中 LocateAnything 定位数据贡献 2.31M 条有效记录、占完整混合的 12.0%。 最后一步加入视觉定位并把混合从 11.57M 扩到 19.28M 后,R2R-CE SR 在 4B 与 8B 上仍分别提高 3.3 与 2.9 点;带跨具身数据的 4B(69.2 SR)超过仅用 VLN 训练的 8B(65.3),完整 4B(72.54)超过未加最终定位步骤的 8B(71.6)。
启示与展望
该接口面向需要在连续环境中执行长程指令的具身导航系统:仿真侧覆盖 R2R-CE、RxR-CE、MP3D 与 HM3D v2 上的 object-goal navigation 与 embodied question answering,真机侧覆盖 Unitree Go2 上的单目 RGB 输入、远程或板载 VLA 推理与 LiDAR 危险监控。作者表示将公开全部模型、代码与评测记录,因此后续工作可在同一 harness 上替换更强的推理模型或动作策略。运行时设计允许 Planner 在 VLA 继续执行时复查固定状态副本,仅在需要修正或终止时打断,这一结构适合把周期性复查替换为事件触发复查。
消融研究使用固定 100 集 R2R-CE 子集,作者说明该子集覆盖 11 个场景中的 10 个、指令更短且长度分布更窄,并指出这只能确立所列属性的覆盖与相似性,不能确立代表性或执行协议等价,全量划分结果才是基准比较的依据。跨 Planner 的比较描述的是完整的 Planner–scaffold 组合,而非孤立地对底层模型排序。object-goal 与 EQA 的对照使用 500 集子集,NavGPT-3 没有全量划分运行。数据与模型规模曲线每一步同时改变数据量与来源构成,因此衡量的是累积配方而非单一来源的价值。真机评测为 30 试次、五条路线、三种事件时机与两次重复,作者也说明检测器的假阴性与假阳性由独立于检测器输出的标注给出。此外,正文中若干公式、表格数值与图注在所提供的文本中不完整,若需核对具体系数、学习率与逐项数值,应查阅原文图表。
