EmbodiedRSI 用假设图与信息价值实验选择让冻结 VLA 在 RoboCasa365 达 77.0%、LIBERO-Pro 达 86.8%,并零样本迁移真机达 71.3%
核心概要
EmbodiedRSI 是一个自演化智能体框架,在冻结机器人基础模型之外,用假设图维护代码与技能假设,用信息价值实验选择挑出最能区分假设的物理实验,并以代码—技能协同演化与奖励驱动的分层记忆学习把每次物理交互转化为可复用改进;在 RoboCasa365 上总体成功率 77.0%、Composite-Unseen 71.3%(最佳基线 40.1%),LIBERO-Pro 总体 86.8%,并将仿真中演化的框架零样本迁移到真机,总体成功率 71.3%。
Figure 1: The EmbodiedRSI Self-Evolution Loop. Physical outcomes guide code and skill updates while the robot foundation model remains frozen.
arXiv深度剖析
提出快—慢双系统架构:快系统依据当前假设权重与实验成本选择下一次物理实验并快速迭代代码与技能更新,慢系统构建分层记忆(M1 记录物理执行、M2 维护假设图、M3 保留可复用认知),把过去经验抽象后回馈给下一次实验选择。 此前的自演化机器人框架把物理试验当作无差别消耗资源,缺少显式决定“下一个实验该做什么”的机制;该架构把物理试验当作稀缺资源主动分配。 方法层面给出问题形式化(式 1–3)、假设置信度后验均值(式 4)、探索不确定性(式 5)与信息价值选择准则(式 6),并说明实验配置与算法流程见附录 D、E。
提出代码—技能协同演化:在同一初始状态下分别评估代码假设、技能假设与二者联合执行,用联合增益(式 7)判断代码与技能是否相互增强,并在假设图中以双向 works-with 边记录最强关系,同时用有向 refines 边保留修订历史。 以往代码与技能常通过彼此分离的过程演化,而长时程操作往往依赖二者的交互;该工作把二者的联合效应作为可追溯证据纳入更新决策。 消融在固定冻结 VLA、任务套件、物理实验预算与评估协议下比较代码单独演化、技能单独演化与协同演化,并报告成功率与学习效率差异。
提出奖励驱动的记忆学习:用冻结的 Qwen3-Embedding-0.6B 编码经验、检索记录与动作描述,由可训练策略在 Retain、Merge、Abstract、Compress、Forget、Skip 动作空间中选择记忆操作,以 PPO 按对后续快系统改进的下游价值(任务提升、探索不确定性下降、物理实验效率)训练。 以往记忆多按检索与复用目的累积,而非按是否改善后续自演化来学习;该工作把记忆选择变成以闭环奖励为目标的强化学习问题。 消融显示 Composite-Unseen 成功率由检索式选择的 61.7%、仅任务奖励 PPO 的 65.2% 提升到 71.3%,学习 AUC 由 0.556、0.589 提升到 0.635。
在 RoboCasa365 上总体成功率 77.0%(Atomic-Seen 94.4、Composite-Seen 63.1、Composite-Unseen 71.3),LIBERO-Pro 总体 86.8% 并在全部八个扰动单元领先 Harness VLA(72.1%);在冻结 SmolVLA 的真机 SO-101 上,零样本迁移框架把总体成功率从 46.0% 提升到 71.3%。 相对端到端冻结 VLA、世界模型基线、排行榜条目以及基于冻结 VLA 的代码即策略与框架智能体,该工作在未见任务组合与指令/位置扰动下取得更高成功率,并展示仿真演化框架可直接用于真机。 两个仿真基准每任务 10 个随机种子、每种子 10 次试验,演化用 10 个种子、评估用另外 10 个互不相交种子;真机每任务每条件 30 次试验,SmolVLA 在全部试验中保持冻结。
启示与展望
该结果面向在冻结机器人基础模型之外、以少量物理试验进行执行层适应的场景:仿真基准为 RoboCasa365(Atomic-Seen、Composite-Seen、Composite-Unseen)与 LIBERO-Pro(指令重定向 T 与位置交换 S 扰动),真机为 SO-101 机械臂配 SmolVLA,任务涵盖多步操作、语义与算术推理、精细抓取。方法适用于希望在不重新训练底层模型的前提下,把物理交互转化为可复用代码、技能与记忆的研究者与工程团队;其收益在需要重组已学行为的新任务组合与物体布局变化时最为明显。
读者仍会关注:假设图与记忆在更长时程、更多任务族上的扩展行为;信息价值选择在物理实验成本权重变化时的敏感性;真机结果中 Glasses Bridge Grasp 一项从 60.0% 变为 56.7% 的具体原因;以及论文自述的局限——代码即策略与智能体框架方法从物理轨迹学习可执行行为而不更新机器人基础模型参数,未来可用框架选出的轨迹做在线模型更新。此外,本次解析基于正文与表格,公式与算法细节位于附录 D、E、F、I,附录内容未包含在可读文本中,因此对阈值、成本权重与训练超参的具体取值无法在此核对。
