跳到主要内容
返回时间线
arXiv来源发表:

HarnessPAI 用可进化代码外壳让机器人不重训模型就在 LIBERO-PRO 上提升 61.6 分

核心概要

该工作提出 HarnessPAI——一个与模型和本体无关的 Physical AI 外壳框架,把代码当作组织底层动作原语的可执行、可进化接口:单次 rollout 内以固定程序开环执行,跨 rollout 用执行反馈闭环修订程序并把失败蒸馏为可复用技能;在桌面机械臂、家用机器人、扫地机器人和腿式行走智能体上,无需重训底层模型即优于纯动作模型与 code-as-policy 基线,在 LIBERO-PRO 上较 π0.5 提升 61.6 分、在 RoboCasa 原子任务上较 WorldDreamer 提升 27.2 分,且收敛后的程序可作为专家数据采集器,用其数据微调 π0.5 使 LIBERO-PRO 成功率再提升 38.8 分。

AI-generated editorial illustration: HarnessPAI: An Evolving Harness for Physical AI

深度剖析

提出 HarnessPAI,一个与模型和本体无关的 Harness 框架,把代码视为可执行且可进化的接口来组织底层动作原语。 既有 Physical AI 研究主要聚焦动作模型这一把观测映射到低层控制的环节,而该框架把感知、任务理解与推理、动作执行整合进统一系统。 原文以框架描述与跨多类本体的实验呈现,摘要层面未给出消融或统计细节。

框架区分两个时间尺度:rollout 内以固定程序开环执行并检查,跨 rollout 用执行反馈闭环修订程序、把失败蒸馏为可复用技能。 这种双层设计使程序一旦选定,rollout 执行不再需要在线高层 LLM 推理。 原文明确说明“Once a program is selected, rollout execution requires no online high-level LLM deliberation”,属于设计层面的陈述。

在桌面机械臂、家用机器人、扫地机器人和腿式行走智能体上,无需重训底层模型即超过纯动作模型与 code-as-policy 基线。 相对 π0.5 在 LIBERO-PRO 上提升 61.6 分,相对 WorldDreamer 在 RoboCasa 原子任务上提升 27.2 分。 原文给出上述两个具体增益数值,并说明覆盖多类本体,但摘要未提供样本量或方差信息。

收敛后的程序可作为低成本、可靠的专家数据采集器,用其数据微调 π0.5 使 LIBERO-PRO 成功率提升 38.8 分。 把执行阶段产出的程序进一步转化为训练数据来源,形成从执行到数据再到模型改进的回路。 原文给出 38.8 分这一具体数值,未在摘要中说明数据规模或微调配置。

启示与展望

该结果面向希望在不重训底层模型的前提下提升具身智能体鲁棒性的研究者与工程团队,适用于桌面机械臂、家用机器人、扫地机器人和腿式行走智能体等已测试的本体与 LIBERO-PRO、RoboCasa 等基准设定。其价值在于把代码外壳作为可复用、可验证的中间层:程序选定后 rollout 无需在线高层 LLM 推理,收敛程序还能充当专家数据采集器,为后续微调提供数据来源。

摘要层面缺少样本量、方差、统计检验与消融信息,61.6、27.2、38.8 三个增益的稳定性尚待正文确认;程序进化所需的执行反馈规模、失败蒸馏的具体机制、以及在不同本体间迁移时的调参成本,都是读者需要继续留意的开放问题。此外,本次仅基于摘要文本,未读取图表与附录,因此对实验细节的概括以原文陈述为限。

来源