GPT-6 Astra 作为具身策略的六域评测:导航领先、混合控制提升操作成功率,但直接手内控制与密集参考运动仍不可靠
核心概要
该工作系统评测 GPT-6 Astra 在夹爪操作、灵巧操作、移动操作、导航、运动与类人全身操作六个领域的具身策略能力,比较直接控制与配合学习策略或全身控制器的混合控制,发现导航表现领先(RxR 指令跟随 92%、HM3D 物体搜索 82%),混合控制在 RoboDojo 达 48%、DexJoCo 达 50%、RoboCasa365 达 38.7%,而直接手内控制与密集参考运动仍不可靠,并记录了显著的 token 消耗与推理延迟。
深度剖析
在六个领域给出统一评测,区分 Astra 直接生成机器人命令(Direct)与配合学习策略或全身控制器(Hybrid)两条控制路径,并保留各研究原有指标与协议。 此前对 Astra 的评测多集中在操作任务且表现不均,该工作把导航、运动、类人全身操作纳入同一框架,并显式区分固定配置评测与开发性试验。 覆盖六个领域、多个基准与固定子集,报告样本量、比较条件与共享初始状态;作者说明固定配置评测与开发试验分开报告。
混合控制在多个操作基准上优于直接控制:RoboDojo 上 Hybrid 成功 24/50(48%)对 Direct 13/50(26%),平均 Score 62.60 对 37.81;灵巧操作十任务平均分 Hybrid 61.6、策略 44.2、Direct 16.6;RoboCasa365 上 Hybrid 29/75(38.7%)、Direct 25/75(33.3%)、单独策略 17/75(22.7%)。 结果显示 Astra 的介入是选择性的:RoboDojo 中 85.6% 的执行控制步沿用策略动作,仅 14.4% 由 Astra 生成或修正;灵巧操作中 Astra 介入仅占 11.98% 的执行步。 各基准给出配对或共享初始状态的比较、每任务多次重复与部分完成分数;RoboCasa 报告了配对成功/失败计数与探索性 McNemar 检验结果。
导航是 Astra 表现最强的领域:在本地比较中,RxR 指令跟随成功 46/50(92%)、R2R 39/50(78%)、HM3D 物体搜索 41/50(82%)、MP3D 28/50(56%),成功率和 SPL 均高于所评测的已发布导航策略。 物体搜索的 SPL 仅 22.43%(MP3D)与 43.69%(HM3D),说明成功率掩盖了搜索绕路;作者据此把路径效率与成功率分开报告。 四个子集各 50 个 episode,与已发布策略使用相同 episode 列表、评分规则与动作预算;相机设置与动作适配器差异在附录中说明。
直接手内控制与密集参考运动仍不可靠:圆柱旋转在容差内的步数比例为 0.51%(RL 76.90%),长方体为 4.40%(RL 63.50%);单条障碍赛道五次连续尝试均未到达终点,而 PASSAGE 在 13.18 秒内到达。 作者把失败归因于维持抓握与重组手指接触之间的张力,以及密集参考需要根速度、肢体姿态与其演化相互兼容,而不仅是关节限位。 手内任务使用配对保存的物理初始状态,但观测与决策频率不同;运动部分为单条赛道的适应轨迹而非五次独立试验,另有不含 Astra 的解析式紧凑参考诊断。
启示与展望
该工作面向希望了解通用模型在机器人控制中能承担何种职责的研究者与工程团队,适用于仿真基准与固定子集下的评测设置,其结论以具体接口、控制器与提示配置为前提。对实践者而言,它提供了两条可操作的路径:在导航与任务级决策上让模型主导,在接触密集的操作与运动生成上让学习策略或全身控制器承担低层动作,并让模型负责目标修正、接触条件准备与完成检查。资源计数与延迟记录也为估算推理预算提供了参照。
手内控制中 Astra 与 RL 的观测与决策频率不同,运动部分为单条赛道的适应轨迹而非独立重复试验,紧凑参考诊断中两个生成器本身不同,因此维度的影响未被单独分离。物体搜索的成功率与路径效率差距提示绕路问题仍需更细的失败分析。此外,部分结果来自开发性试验与研究者对提示、接口或控制器设置的调整,模型权重固定但系统配置会变化,跨场景的稳定性仍需更多重复与迁移验证。
