RLE-Bench 用 51 个机器人学习任务考编码智能体:GPT-6 Astra 与 Claude Fable 5.1 领先,机械设计全员失手
核心概要
研究者提出 RLE-Bench,把 51 个机器人学习任务按交互控制、策略学习、感知与估计、机械设计四条工作流组织,用任务专属指标聚合成 RLE Index,评测 11 个模型–harness 组合,发现 GPT-6 Astra 与 Claude Fable 5.1 大幅领先、策略开发环节差距最小、而所有模型在机械设计上都无法稳定做出合理设计决策。
深度剖析
RLE-Bench 把机器人开发拆成四条工作流、九个任务族、共 51 个任务,每个任务由指令、公开开发环境、资源预算、可执行产物契约、验证器控制的评测环境和验证器组成,产物涵盖智能体上下文、harness 代码与手册、模型检查点、位姿估计代码、端到端控制器代码以及 MJCF 设计与控制器代码。 既有机器人基准主要评测单个产物(策略或控制器),CaP-X 虽评测编码智能体但局限于把代码写成策略;RLE-Bench 把控制器合成、机器人策略训练、感知与估计、机械设计同时纳入同一套评测。 论文给出任务族与工作流对照表,并说明任务来自复用开源基准与自行手工设计两类来源;评测在隐藏场景、动力学、本体、随机种子或留出任务下由基准自有仪器完成。
在 11 个模型–harness 组合上,GPT-6 Astra 与 Claude Fable 5.1 明显领先,优势集中在交互控制与感知估计这两类需要解读多模态观测、依赖反复环境反馈的工作流;策略开发环节各模型差距明显更小;机械设计环节差距同样很小,且没有模型能持续做出合理设计决策。 该结果把“编码智能体能否做机器人工程”从单一排行榜扩展为按工作流的能力画像,并指出视觉 grounding 与物理后果推理是区分模型的两条不同轴线。 结论来自 11 个组合在 51 个任务上的 RLE Index(四条工作流分数的等权宏平均)与逐工作流分数对比;论文同时报告了原生物理量诊断,如运动跟踪误差、存活率、清箱率与每分钟零件数。
开发期评测反馈能带来真实且前置的改进:在 36 个会话中有 29 个提交版本优于智能体首次开发期评测;但改进受反馈可测量范围限制——在可排练的开放设计子任务上开发分数与官方分数相差 5 分以内,而在测试时扰动从不展示给智能体的鲁棒性子任务上,官方分数比开发分数低 19 分(LIBERO)和 41 分(RoboTwin)。 这把“评测反馈是否有效”从定性判断变成可回放的开发曲线证据,并给出反馈收益的边界:智能体自建扰动代理也无法弥合鲁棒性差距。 论文记录并回放了开发期评测服务的使用过程,给出 29/36 的会话级比较与两类子任务的分数差;作者据此指出构建鲁棒策略仍是难题。
外部机器人脚手架通常有帮助,但随模型变强而收益递减:L1 提供基础机器人与传感器 API,L2 加入 SAM3 与 Contact-GraspNet,L3 再加入特权物体与固定装置位置;更丰富的脚手架对多数模型提升分数并降低成本,而 GPT-6 Astra 在 L1 下已表现强劲,增加支持收益很小甚至偶尔下降。 这为“给智能体加外部模块”提供了一个能力相关的条件性结论,而非普遍有效的默认做法。 结论来自同一任务族内三个脚手架等级的对照实验,覆盖 GPT-5.6、Opus 系列、Gemini-3.7-Flash 与 GPT-6-Astra 等模型。
启示与展望
这套基准面向的是机器人学习工程能力的评测与比较:研究者、智能体开发者以及需要判断编码智能体在物理任务上能走多远的团队,可以在仿真环境中用它做可复现的横向对比,并借助工作流画像与成本数据选择模型与脚手架配置。作者也说明其定位是“资格考”,用于开发能构建、测试并改进可靠机器人学习系统的智能体。
作者列出的范围限制包括:仿真表现不能确立真实世界的可靠性与安全性,模拟场景的规模与多样性不足以覆盖所有部署条件;四个工作流只覆盖机器人学习工程师工作的一部分;计划中的公开发布存在未来训练数据污染的风险。此外,机械设计任务中“所有九个模型在静态稳定裕度上获得零最差臂得分”这一结果,提示可见目标与耦合物理后果之间仍有未被评测覆盖的推理环节;开发期反馈与官方分数在鲁棒性子任务上的 19 分与 41 分差距,也留下“如何让智能体自建有效扰动代理”的开放问题。
