PyRUA-Lean 让 GPT-6 Astra 机器人智能体成功率从 63.1% 升至 71.7%,同时减少 65% 输入 token
相关研究与后续进展核心概要
作者提出 PyRUA-Lean——一种交互式代码执行框架,将反馈驱动的机器人原语组合与选择性观测结合,让智能体把经典机器人原语与学习到的视觉-语言-动作(VLA)策略组合进 Python 单元以执行条件检查与局部重试,仅返回显式请求的图像与状态反馈用于重新规划;在 LIBERO-PRO、RoboTwin 2.0 与 RoboCasa365 的 700 个模拟任务实例上,与使用同一 GPT-6 Astra 规划器和相同底层机器人原语的工具调用基线相比,在相同 LLM 调用预算下总体成功率由 63.1% 提升至 71.7%,在两者均解决的实例上减少 49% 的 LLM 调用与 65% 的输入 token。
Figure 2 : PyRUA-Lean combines primitive composition with selective feedback. (a) The tool-calling agent invokes robot primitives through tool calls. Operations that depend on preceding results generally require another VLM turn, and motion calls automatically return images and state. (b) PyRUA-Lean instead generates Python cells that compose robot primitives with helper functions, conditional checks, and local retries. Intermediate execution stays within the runtime, while explicitly requested images and state messages are recorded and returned at cell end for replanning. (c) A recorded placement example illustrates both mechanisms: one PyRUA-Lean cell replaces baseline steps 14–17, reducing four LLM turns to one. The cell computes a placement target from scene geometry (compose), conditionally executes lowering and release (compose), and requests an image only if the task remains unfinished (select). This successful execution returns five printed lines and no image, demonstrating how programmatic composition and selective feedback reduce repeated model interaction. Appendix A follows the whole episode.
arXiv深度剖析
PyRUA-Lean 在相同 LLM 调用预算下把总体任务成功率从 63.1% 提升到 71.7%。 此前 VLM 智能体通过视觉反馈与动作原语控制机器人,但重复的模型调用与冗余观测带来大量 token 开销;该工作把反馈驱动的原语组合与选择性观测耦合进一个交互式代码执行框架。 证据来自 LIBERO-PRO、RoboTwin 2.0 与 RoboCasa365 三个模拟基准共 700 个任务实例,并与使用同一 GPT-6 Astra 规划器和相同底层机器人原语的工具调用基线在相同 LLM 调用预算下对比。
在双方都解决的实例上,PyRUA-Lean 使用少 49% 的 LLM 调用和少 65% 的输入 token。 效率提升来自让智能体把经典机器人原语与学习到的 VLA 策略组合进 Python 单元,在其中执行条件检查与局部重试,并且只返回显式请求的图像与状态反馈用于重新规划。 该效率对比限定于两个智能体均成功解决的实例,属于同任务子集上的配对比较,而非全部 700 个实例。
该框架把“代码执行 + 选择性观测”确立为降低 VLM 机器人智能体 token 开销的一种可行路径。 与逐次工具调用的交互方式相比,把控制逻辑下沉到可执行代码单元中,使条件判断与重试在本地完成,从而减少往返模型调用。 证据为三个模拟机器人基准上的受控对比,规划器与底层原语在两个条件下保持一致,因此差异可归因于交互框架本身。
启示与展望
该结果面向使用 VLM 规划器、并拥有可组合经典原语与学习型 VLA 策略的机器人智能体场景,尤其是需要在有限 LLM 调用预算下完成多步操作任务的设定。它说明在模拟基准上,把控制逻辑放进可执行代码单元并只按需取回观测,可以在同等预算下同时改善成功率与调用效率,因此对构建低成本机器人智能体流水线的研究者与工程师具有直接参考意义。
本文档为摘要级材料,未包含论文正文、图表与消融细节,因此无法判断成功率提升在三个基准之间如何分布、哪些任务类型受益最大,也无法确认选择性观测与局部重试各自的贡献。此外,全部证据来自模拟任务实例,真实机器人上的表现、以及在不同规划器或不同原语库下的可迁移性,仍是需要进一步观察的开放问题。
