InterEvolve 让固定人形控制器在测试时进化奖励程序,仿真成功率从 34.6% 升至 86.5%,并在 Unitree G1 上自主运行
核心概要
InterEvolve 提出一种测试时进化框架:用一个物体感知的前向-后向(FB)行为基础模型执行奖励程序,由 LLM 智能体在上下文中修改程序结构、CMA-ES 调节其常数,并在并行仿真场景中验证每个候选,从而让固定的人形控制器无需再训练即可完成未训练过的 loco-manipulation 任务,在八个任务族上把宏平均成功率从最佳校准固定程序的 34.6% 提升到 86.5%,并把进化出的技能部署到实体 Unitree G1 上。
深度剖析
框架把任务特定算力从训练转移到测试时进化:LLM 智能体在上下文中编写和修改奖励程序,由固定的可复用控制器执行,用于新任务和新场景。 以往的语言模型奖励设计方法(如 Eureka、Text2Reward 一类工作)每个候选奖励都要训练一个新策略,而这里每个候选奖励只需在固定控制器上跑一批 rollout,验证过的程序还进入技能库供后续任务检索。 论文给出三方面贡献陈述,并在八个任务族上报告宏平均成功率 86.5%、Earned 95.6%、2.1 GPU-h、0.23 M tokens;消融显示去掉 CMA-ES 调参降到 51.6%,去掉多阶段降到 44.7%。
提出物体感知的 FB 行为基础模型:在冻结的身体先验上附加可训练的物体残差,读取物体位置、朝向、线角速度以及身体连杆到最近物体表面的距离衰减向量,把奖励目标翻译为全身交互行为。 此前的 BFM-Zero 等人体 FB 模型只观测身体,仅物体目标不同的奖励会坍缩为同一行为;这里让 actor 与前向、后向映射都接入物体信息,并在人-物交互数据上训练残差分支。 跟踪基准上物体感知模型 SR 60%、物体表面误差 30.80 cm,而仅身体的 BFM-Zero SR 8%、物体误差 62.33 cm;去掉连杆几何 SR 降到 12%,去掉物体状态降到 20%,从零训练只有 2%,残差宽度增大 SR 从 28% 升到 60%。
奖励程序把任务表示为带完成条件和可调常数的分阶段奖励,结构由 LLM 修改、常数由 CMA-ES 调节,二者嵌套搜索。 常见任务接口(运动参考、目标状态、技能标签)难以表达接触丰富、多阶段的交互;这里把奖励本身作为可编辑的任务策略,并显式分离结构与常数。 消融显示强制单阶段损失最大(SR 44.7%),去掉数值调参次之(51.6%),去掉定向编辑(68.9%)与去掉多场景评估(68.4%)代价相近,场景上下文影响最小(78.7%)。
进化出的经验可复用与组合:技能库记录已完成任务的场景、任务文本、验证器通过率与选定程序,复合任务在库覆盖其接触模式时被解决。 以往工作多把经验留在策略权重里;这里把经验存成可读、可编辑、可检索的文本程序,后续任务在其基础上进化而非从零重发现。 三个复合任务上,完整技能库解决 8/10 重定位、4/10 堆叠、5/10 搬运-放置-踢击,无技能库时几乎为零;直接运行存储程序几乎不成功(踢击 6.3%,其余 0.0%),说明增益来自搜索对存储程序的适配。
启示与展望
该结果面向已有广泛全身运动先验的人形控制器,在仿真中验证,并在一台实体 Unitree G1 上以自视角机载感知运行两个进化出的任务;适用场景是任务结果与物理约束可被固定验证器判定的 loco-manipulation 任务族,包括推动、搬运、翻转、踢击、上架与绕障,以及由这些接触模式组合而成的长时程任务。对读者而言,这意味着可以把“任务知识”从策略权重中拿出来,写成可读、可编辑、可检索的奖励程序,让同一个控制器在测试时被反复调用;对做机器人学习或具身智能的团队,它提供了一条以仿真 rollout 换取任务适配、并把成功经验沉淀为技能库的路径。
程序搜索受限于控制器的运动库、奖励推断 bank 与可用测量,无法引出控制器从未学过的行为;每次搜索要消耗仿真 GPU 小时与语言模型延迟,因此不支持物理执行期间的实时重规划。跨物体迁移按任务族差异明显,推动到标记在其他箱体上最多 25%,小箱几乎无法被推过障碍;踢击在训练数据中稀少,仍是最难的任务族。技能库的复用取决于是否覆盖任务所需的接触模式,仅搬运库对堆叠与踢击帮助有限。成功随测试时扩展增长但并非单调,第 2 轮到第 3 轮完整成功率一度回落,因为同一 rollout 内需同时满足全部判据。让累积经验反过来更新控制器,作者列为下一步。
