跳到主要内容
返回时间线
arXiv来源发表:

RoboQuest基准显示:最强前沿多模态智能体在需主动探索的十项厨房操作任务中仅成功23%

核心概要

作者提出RoboQuest,一个面向目标导向具身探索的基准,包含十项移动操作任务,覆盖搜索、操作式检查与交互测试三类不确定性;五个前沿多模态智能体通过统一视运动接口零样本执行,最佳者仅成功23.2%,而用所发布5000条演示微调的VLA策略几乎从不成功;隔离技能测试显示智能体在给定隐藏信息时能完成多数动作,失败分析将仅18–21%的失败归因于执行,多数源于探索过早停止与证据不足即决策。

Source-provided article image: RoboQuest: Generalist Physical Agents that Search, Inspect and Test
Figure 1 ·

Figure 1: A visual depiction of the salient features of RoboQuest that includes tasks demanding information-seeking physical interactions with active perception.

arXiv

深度剖析

RoboQuest把任务关键信息从初始观测中移除,且不能靠被动观看解决,必须通过物理交互获取证据,任务分为搜索、检查、测试三族共十项,每项只给出可外部验证的物理目标,调查策略完全留给智能体。 既有操作基准(RLBench、LIBERO、CALVIN、ManiSkill3、RoboTwin 2.0、BEHAVIOR-1K、RoboCasa365、RMBench)在完全或即时可观测条件下评估,主动感知类工作多限于视角调整或单步去遮挡;RoboQuest把探索扩展到定向搜索、主动检查与交互测试,且探索可不可逆地改变环境。 十项任务在RoboCasa365厨房、MuJoCo中运行,Franka Panda臂加移动底座,20 Hz控制,两路场景相机加腕部相机;每任务50个实例,覆盖18种厨房布局与5种风格,所有智能体玩同一批实例。

五个前沿多模态智能体零样本成功率普遍很低,GPT-6 Astra最高为23.2%,Opus 5.5、GPT-6.1 Sol、Fable 5.1为11–14%,Gemini 3.8 Flash为2.0%;去掉最易的Puzzle Box后GPT-6 Astra为15.1%。 这是首次在同一视运动接口下对多个前沿模型做目标导向具身探索的系统评测,并同时报告成功率、进度、成本与结束方式。 每模型500个episode,共2500个;总成本21,352美元,从GPT-6.1 Sol的997美元到Fable 5.1的9,610美元;GPT-6 Astra在10项任务中的7项成功率最高,仅Wobbly Stand上Opus 5.5领先。

隔离技能测试与失败分析一致表明瓶颈在探索与决策而非执行:三模型在隔离技能上总体成功72–81%,失败分析将18–21%的失败归因于执行,缺失证据(43/43/46%)与错误决策(23/31/25%)合计占66–74%。 该工作把执行能力与探索能力分离测量,并用逐单元确定性规则把每个失败归因到最早未修复的断点,从而定位失败来源。 隔离测试每技能20个场景;失败分析覆盖GPT-6 Astra/Opus 5.5/GPT-6.1 Sol的931/1143/1182个单元,来自384/431/439个失败episode;遮挡对照实验中隐藏物体使成功率下降8–10个百分点,且新增失败全部落入缺失证据。

探索常过早停止且扰动很少被预防或修复:约一半失败中所需物体从未被放置,其中27–29%仍藏在从未打开的容器里,而藏匿处本身很少被漏看(仅1–2%失败源于从未观测到);副作用占7–13%,约三分之二涉及物体落地,38次找回尝试仅4次成功。 这些模式揭示了标准VLA与推理型智能体在证据获取、证据保持与后果监控上的具体薄弱环节,而非单纯操作能力不足。 失败归因基于每20 Hz tick记录的模拟器状态与交付给模型的相机视图,用真值分割掩码判定可见性,规则与逐单元标签随基准发布;交互式试错在Puzzle Box加盖上对Opus 5.5使成功率从94.4%降至36.8%,而GPT-6 Astra几乎不受影响。

启示与展望

该基准面向在RoboCasa365厨房、MuJoCo中运行的移动操作智能体,适用于评估在初始观测缺失任务关键信息、需通过物理交互获取证据并自主决定提交时机的场景;十项任务覆盖搜索、检查、测试三类不确定性,每任务50个实例,评测集保留厨房风格与部分任务配置,因此适合衡量对未见场景与配置的零样本探索能力。发布的5000条演示(每任务500条,20 Hz下366小时)与逐帧两级语言标注可用于训练与诊断,隔离技能测试与逐单元失败归因规则可用于定位探索与执行的相对贡献。

读者仍需关注:结论基于MuJoCo模拟与所测五个前沿模型及一个微调VLA,向真实机器人与其他架构的推广尚待检验;失败归因中副作用究竟源于未预见后果还是碰撞,文本说明无法从记录数据判定;部分表格与图(如Fig. 3、Fig. 5、Fig. 7)在解析文本中未完整呈现,具体数值细节需查阅原文;微调策略在多数任务上成功率为0.0%且多因超时失败,其训练与推理细节主要在附录C。

来源