跳到主要内容
返回时间线
arXiv来源发表:

RoboFoundry 把智能体系统本身当作策略来进化,在 EmbodiedBench 上把 GPT-5.5 提升 27.8%,并在真机上实现零样本迁移

核心概要

RoboFoundry 提出“自进化系统即策略”(Self-Evolving System-as-Policy)框架,把支撑基础模型的整个智能体系统(上下文系统与分层技能系统)而非模型参数当作可进化策略,通过执行轨迹诊断能力缺口、生成并验证任务级系统修改、再把可复用的改进提升为通用系统能力,在 EmbodiedBench 上取得最优表现(GPT-5.5 提升 27.8%,Qwen3.7-Plus 达 70.3% 接近 GPT-5.5 的 72.7%),在 RoboMemArena 长时程记忆上至少超出所有基线 39.0%,在 LIBERO-PRO 上相对 Cap-Agent0 提升 243.8%–679.7%,并在真实机器人上展示零

AI-generated editorial illustration: RoboFoundry: System-as-Policy Evolution for Self-Learning Embodied Agents

深度剖析

论文把可执行具身策略重新定义为“系统”而非孤立模型,并提出 RoboFoundry 让这个系统自身成为进化对象:进化发生在两个互补表面——管理活跃内部上下文与持久文件系统记忆的上下文系统,以及组织原子技能、可复用组合与失败条件恢复的分层技能系统。 此前工作通常只优化智能体栈中的单个组件(交互框架、记忆、技能或动作接口),而 RoboFoundry 让执行历史决定“系统的哪一部分该改、改动该传播多远”,把 code-as-policy 推进到 system-as-policy。 论文以方法章节给出内层执行—外层进化的双循环形式化,并说明模型通过 cat、grep 等文件系统操作检视系统、通过 add、modify、delete 编辑系统,基础模型参数保持冻结。

论文提出能力引导的上下文—技能协同进化机制:任务级系统策略把失败或低效归因到六种能力(前三种刻画决策、后三种刻画记忆管理),定位缺口并只修改对应表面;成功修复先就地验证,只有当同一改进在其他任务的留出轨迹上被验证为针对同一能力缺口时才提升为通用系统规则。 这把自进化从不受约束的自我改写变成“诊断—干预—验证—提升”的受控闭环,并给出能力条件化迁移的评分式判定,而不是仅靠单次任务成功就固化修改。 论文给出任务级与通用级两层优化目标,并报告消融:仅保留任务级编辑的 RoboFoundry-Lite 在 Qwen3.7-Plus 上低于完整版,作者据此把通用范围进化识别为关键成分。

论文引入共享语义接口,把具身无关的决策与具身相关的执行分离:决策以语义单元表达一次,由可替换的具身绑定通过机器人特定原语实现,因此在一个平台上进化出的系统可通过替换绑定复用到另一平台,同一进化支持也可挂接到不同基础模型。 这使进化出的能力不再绑定于单一机器人或单一骨干模型,为跨异构机器人与跨基础模型的迁移提供了机制基础。 论文在五个基础模型(GPT-6 Astra、GPT-5.5、Qwen3.7-Plus、Qwen3.8-27B、GLM5.3-Flash)上报告一致增益,并在真机上把折叠技能从蓝色毛巾零样本迁移到外观、几何与材质不同的绿色和粉色毛巾。

论文在多个基准与真实部署上报告系统级进化的效果:EmbodiedBench 上 GPT-5.5 提升 27.8%、Qwen3.7-Plus 达 70.3% 接近 GPT-5.5 的 72.7%;RoboMemArena 上 TSR 与 CSR 均优于所有基线且至少超出 39.0%;LIBERO-PRO 上相对 Cap-Agent0 提升 243.8%–679.7%;真机上完成嵌套娃娃操作、毛巾折叠零样本迁移、Unitree G1 语义导航与六步化学实验。 这些结果把“系统即策略”的主张从单一基准扩展到决策、长时程记忆、分布偏移鲁棒性与真实机器人四类设置,并显示开源骨干可被拉近前沿模型水平。 EmbodiedBench 覆盖 1,128 个任务、四个环境;RoboMemArena 含 26 个任务、四类记忆;LIBERO-PRO 按 CaP-Agent0 协议在 Object、Goal、Spatial 三个套件的 30 个任务上、每任务每扰动 50 次试验评估;真机每任务报告 10 次试验成功率。

启示与展望

该框架面向把基础模型作为决策核心的具身智能体,适用于具备可写文件系统工作区、可记录执行轨迹、且能在任务间重置状态并保留已验证修改的仿真与真机设置;其收益来自对上下文系统与分层技能系统的持久修改,而非更新基础模型参数。对读者而言,这意味着可以把它当作“部署后继续进化”的系统层方案来理解:在仿真基准上它同时改善决策、长时程记忆与扰动鲁棒性,在真机上它支持零样本迁移与在线进化,并可通过替换具身绑定把同一进化系统复用到不同机器人、挂接到不同基础模型。论文也指出感知仍是瓶颈:在 LIBERO-PRO 上提供特权物体位姿后,六个设置的成功率均提升,Object 与 Goal 任务扰动达到 100%。

读者仍会关注若干开放问题:通用级提升的判定依赖能力条件化留出轨迹的评分,这一验证在任务分布差异更大时如何保持稳定;论文报告 16K 上下文预算下更大预算本身并不稳定提升成功率(如 GLM5.3-Flash 从 4K 的 62.0% 降到 16K 的 61.3%),说明上下文规模与进化收益的关系仍需厘清;真机评估每任务 10 次试验,长期在线进化在更多任务与更长周期下的表现尚待观察;此外,本证据包为全文解析,部分图表以文本形式呈现,个别数值在正文与表格间存在表述差异,具体数字以原论文表格为准。

来源