跳到主要内容
返回时间线
arXiv来源发表:

ART 把 VLA 模型改造成会调用工具的机器人智能体,在仿真与真实任务上成功率比主流基线高 20%

核心概要

该工作提出 Agentic Robot with Tool-use(ART),一个工具注入框架,可调优任意 VLA 模型去调用现成工具模块,用于低层视觉、高层可供性与具身增强;作者构建了 30K 条工具使用轨迹与动作演示的数据集,并设计了面向挑战性环境的长轨迹工具使用推理训练方案,实验显示 ART 在仿真与真实任务(如新视角下的暗光抓取放置)上成功率比主流基线高 20%。

Source-provided article image: Evolve Vision-Language-Action Model into an Agent with On-the-fly Tool-use
Figure 1 ·

Figure 1 : Comparison of VLA Paradigms , including (a) standard end-to-end VLA [ 28 , 4 , 5 ] , (b) VLA enhanced with Chain-of-Thought reasoning [ 50 ] , (c) modular robotic behavior synthesis [ 31 , 34 ] , and (d) our Agentic Robot with Tool use (ART) framework, which intDegrates tool use into the end-to-end action generation process. The ART model demonstrates enhanced adaptability to complex environments (Task 1) and correct hallucinated predictions in foundation models (Task 2) through dynamic tool use.

arXiv

深度剖析

ART 把端到端 VLA 模型与智能体式工具使用结合起来,通过工具调用压缩动作解空间,从而提升跨任务泛化能力并降低数据依赖。 相对使用整块连续动作解空间的 vanilla VLA 模型,ART 以工具注入的方式改写动作求解路径,把低层视觉、高层可供性和具身增强交给现成工具模块处理。 论文摘要给出框架层面的论证,并以泛化性与数据依赖两项优势作为设计目标;具体机制细节在所提供的文本中未展开。

作者构建了 30K 条工具使用轨迹与动作演示的数据集,规模明显小于基线方法所用的数据集。 该数据集是为验证 ART 的低数据依赖优势而专门构建的,而非沿用既有大规模数据。 摘要明确给出 30K 这一数量,并说明其“much smaller than those used by baseline methods”;未提供与各基线的逐项数据量对比。

作者设计了面向挑战性环境的长轨迹工具使用推理训练方案。 训练方案针对长轨迹工具使用推理,而非单步动作预测,以支撑复杂环境中的多步工具调用。 摘要仅说明该训练方案的存在与目标场景,未给出训练细节、阶段划分或超参数。

实验显示 ART 在仿真与真实任务上成功率比主流基线高 20%,任务包括新视角下的暗光抓取放置。 相对主流基线,ART 在仿真与真实两类设置上均报告了成功率提升,并覆盖暗光与新视角这类感知条件不利的场景。 摘要报告 20% 的成功率提升并点名任务类型;未提供样本量、置信区间或逐任务分解。

启示与展望

该框架面向需要低层视觉、高层可供性与具身增强的机器人操作任务,适用于可接入现成工具模块的 VLA 模型,并在仿真与真实环境的抓取放置等任务上验证,包括暗光与新视角条件。对希望以较小数据量训练、并计划后续增量接入新工具的团队,ART 提供了一条模块化路径。

所提供的文本为 arXiv 摘要页信息,缺少正文、图表与实验表格,因此工具模块的具体接口、长轨迹训练方案的分阶段设计、20% 提升的统计口径与逐任务结果都无法在此确认。读者仍需关注:工具调用失败时的回退行为、新工具接入所需的额外调优成本,以及该框架在摘要未列举的其他任务与具身平台上的表现。

来源