PyRUA-Lean 让 GPT-6 Astra 机器人智能体在同等调用预算下把成功率从 63.1% 提到 71.7%,共同解出的任务上少用 49% 调用与 65% 输入 token
核心概要
PyRUA-Lean 是一个交互式代码执行框架,让 VLM 智能体把经典机器人原语与冻结的 VLA 策略组合进 Python 单元,在单元内做条件检查与本地重试,并只把显式请求的图像与状态反馈交回模型;在 LIBERO-PRO、RoboTwin 2.0、RoboCasa365 共 700 个仿真任务实例上,与使用同一 GPT-6 Astra 规划器和同一批原语的工具调用基线相比,同等 LLM 调用预算下总体成功率从 63.1% 升至 71.7%,在两者都解出的实例上 LLM 调用减少 49%、输入 token 减少 65%。
深度剖析
PyRUA-Lean 把机器人原语组合成可执行 Python 单元,单元内可做条件分支、局部重试与几何计算,只有显式打印的输出和被请求的相机图像才回到 VLM 上下文。 此前基于代码的机器人控制(如 Code as Policies、ProgPrompt)与带执行反馈的系统已存在,但本文把重点放在同一批原语之上“交互式代码执行”与“工具调用”两种接口的成功率与推理成本对比。 论文给出接口设计、原语清单(Table 1)与逐单元执行模型,并在附录中统计 700 个 episode 共 11,145 个代码单元的行为:平均每单元执行 2.1 个动作原语,45% 的单元执行两个及以上,而工具调用的一次 LLM 调用平均只执行 0.65 个。
在同等 LLM 调用预算下,PyRUA-Lean 总体成功率从 63.1% 提升到 71.7%,即 8.6 个百分点、约 14% 相对提升,且四个基准分组均有增益。 增益分别为 LIBERO-PRO 11.0 点、RoboTwin 2.0 9.2 点、RoboCasa365 原子任务 7.8 点、复合任务 5.0 点;仅 PyRUA-Lean 解出 96 个实例,仅工具调用解出 36 个。 700 个配对任务实例、1,400 个 episode,每个任务五个环境种子,两个智能体使用同一 GPT-6 Astra 规划器、同一机器人栈与同一批冻结 VLA 策略,且都不使用跨 episode 记忆。
在两者都解出的实例上,PyRUA-Lean 把平均 LLM 调用从 17.0 降到 8.7、输入 token 从 788k 降到 276k,估计成本从每 episode 1.63 美元降到 0.74 美元。 token 分解显示节省主要来自调用次数减少,而非每次提示统一变小:在 RoboCasa365 原子任务上 PyRUA-Lean 的单次调用反而更大,但调用更少仍使总 token 下降。 指标为共同解出子集上的整段 episode 均值与总量比值,计数包含成功后的调用与缓存输入 token;作者同时说明这是会计分析,并未单独隔离各接口特性的因果贡献。
消融显示 token 效率在去掉 VLA 策略或操作指南后仍然存在,但收益随任务结构变化:在 VLA 主导的 RoboCasa365 原子任务上增益最小。 去掉 VLA 策略后,PyRUA-Lean 在 RoboTwin 2.0 上成功率 68.8%,工具调用为 42.8%;而 RoboTwin 2.0 无 VLA 时去掉指南反而把工具调用成功率从 42.8% 提到 60.4%,说明指南的作用依赖接口。 消融在主比较的每个任务实例上运行;作者也指出共同解出子集在不同设置间会变化,因此其 token 成本不能隔离组件效应,且计入失败 episode 后 RoboCasa365 原子任务的成本比约为 1.1。
启示与展望
这项工作面向使用 VLM 规划器、经典运动与感知原语以及冻结 VLA 策略的仿真机器人操作场景,适用于希望在同一调用预算下完成更多任务、并控制哪些观测进入模型上下文的系统设计者。它给出的是接口层面的证据:代码单元内的条件检查、局部重试、持久程序状态与按需取图,可以在不改变底层原语的前提下减少模型调用次数。作者指出后续将测量真机上的执行延迟与恢复能力,并研究原语粒度与跨 episode 复用已验证例程对成功率、推理成本与适应性的影响。
读者仍需留意:评估限于 GPT-6 Astra、RPent 的机器人栈与仿真,每个任务实例每个智能体只运行一次,因此重复运行的波动、其他规划器与真机表现都还是开放问题。作者也说明该对比评估的是完整接口,未完全隔离原语组合、持久状态与选择性反馈各自的贡献;token 分解属于会计分析。此外,仅按需返回图像并不能复现收益——在 LIBERO-PRO 上把工具调用基线改为按需取图后成功率从 83.0% 降到 68.5%,说明观测请求需要与动作执行和重规划一起考虑。96 个仅由 PyRUA-Lean 解出的实例中,52 个是基线耗尽调用预算,44 个是基线自行结束并报告失败,其中约四分之一只是 VLA 策略在两次运行中成败不同,因此成功差异不能完全归因于更好的恢复逻辑。
