跳到主要内容
返回时间线
arXiv来源发表:

把机器人任务写成代码:HexaAnything 在 RoboCasa365 把 Composite-Unseen 成功率从 34.3% 提到 38.3%,并用 Harness 轨迹训练出更强的 HexaModel

核心概要

该工作提出 Physical Coding,用可执行程序同时表示物理世界状态(Code as World)与执行流程(Code as Policy),并实现物理编码智能体 HexaAnything:它把 VLA/WAM 当作可调用的动作工具,由 Harness 负责状态记录、验证与恢复;在 RoboCasa365 上以 XR-1 为动作模型时把 Composite-Unseen 成功率从 34.3% 提升到 38.3%、总体从 56.6% 提升到 61.1%,用 Harness 收集的轨迹微调出的 HexaModel v0.1 在同一 Harness 中每个 split 都优于其基座模型,在 PhyBench 模拟物理实验中平均相对误差低于 5%,并在 Agile

AI-generated editorial illustration: Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence

深度剖析

提出 Physical Coding 这一表示范式:Code as World 记录对象、关系、约束、观测与进度谓词,Code as Policy 组织规划、工具调用、验证、恢复与执行,二者构成状态与动作之间的可执行接口。 此前的代码式机器人系统主要覆盖策略一侧,感知被信任、所学内容存放在模型之外;这里把世界表示与执行流程同时写成可检查、可编辑、可版本化的程序,并由独立验证器判定其是否被证据支持。 论文以形式化定义给出运行时(世界程序、策略程序、Harness、验证器、恢复算子、带溯源的记忆),并用 LoadKebabSandwich 与 PhyBench 的 Hooke 定律实验说明该接口如何把“两个食材都在烤箱内”写成门控谓词。

HexaAnything 在动作模型固定为 XR-1 时提升长程操作成功率:Composite-Unseen 从 34.3% 到 38.3%(+4.0 点),Composite-Seen 从 54.8% 到 61.5%(+6.7 点),总体从 56.6% 到 61.1%;三个 Composite-Unseen 任务各 100 个种子分别提升 31.0、15.0、17.0 点。 增益来自把分解、验证与恢复移入 Harness,而非更换动作模型;对照的通用编码智能体 Codex 在同一模型下总体为 59.5%,在 Composite-Unseen 上为 34.1%,未超过原生 XR-1。 同一任务与随机种子下的对照实验,并附有额外检查:在 PortionHotDogs 上把 VLA 动作预算加倍并未改善原生条件(21/100 对 22/100),而编码智能体条件完成 37/100。

Harness 返回的轨迹可以训练出更好的模型:HexaModel v0.1 由 Qwen3.8-27B 在 Harness 数据(9.3K 条带思维链的 RoboCasa365 VQA 与 1.0K 条智能体轨迹)加通用数据上微调而成,放回同一 Harness 后每个 split 都优于基座,Composite-Unseen 从 37.3% 到 39.5%,总体从 60.5% 到 61.7%。 这给出了一条从执行证据到权重更新的具体路径,而不只是把技能存进记忆或技能库;Harness 数据占 178.6M 训练 token 的 38.8%,其中部分轨迹来自上一轮微调检查点。 同一 Harness、同一任务与种子下的对照;开放 27B 模型在 Composite-Unseen 上达到 39.5%,比同一 Harness 中的 GPT-5.6-Sol(38.3%)高 1.2 点。

同一接口可扩展到操作之外:在 PhyBench 模拟实验室中,HexaAnything 自主设计并执行弹簧劲度系数、重力加速度与耦合振子简正频率三类实验,GPT-6-Astra、Opus 5.5、GPT-5.6-Sol 三种模型在每个任务上的平均相对误差均低于 5%;在 AgileX 双臂真机上七个桌面任务中五个三次全部成功,部分任务比已发表参考更快。 科学实验的成功标准是定量结论正确而非物体到位,这要求把测量条件、读数与拟合都保留为可检查的代码;真机上工具由编程智能体在回合之间编写、验证并冻结,人类与智能体通过同一 URAI 接口调用。 PhyBench 每个模型每个任务 10 次试验,真机每个任务 3 次试验;论文明确指出真机参考结果来自其他硬件与运行限制,且三次试验数量很少。

启示与展望

该结果面向在受控仿真与受限真机环境中工作的具身智能体研究者与工程团队:它说明当动作模型被当作可调用工具、由 Harness 承担状态记录、验证与恢复时,长程操作与定量实验可以在不重训动作模型的前提下改善。对读者而言,可直接沿用的部分是接口设计——把任务要求写成可评估谓词、把验证器与提出动作的模型分离、让通过独立评估的轨迹成为训练数据;论文也给出分阶段路线(Harness 引导、模型–Harness 协同演化、物理部署),并指出真机上工具可由编程智能体在回合之间编写、验证并冻结,人类与智能体共享同一工具接口。

论文自述证据是初步的:Harness 效应只在一个动作模型(XR-1)与一个基准上测量,HexaAnything 相对同一模型驱动的 Codex 总体优势为 1.6 点,且 Codex 在 Atomic-Seen 上更高;长程证据来自 RoboCasa365 内置的复合任务,更长任务已设计但尚未评估;RoboDojo 工具演化依赖很少的种子(Fold cloth 为五个),且该任务中像素由操作者选择;PhyBench 为仿真、每模型每任务十次试验,真机每任务三次试验,参考结果来自其他硬件。论文列出的开放问题包括防止模型与验证器共同适应、从稀疏轨迹学习物理因果、长期记忆的隐私,以及如何组合专家纠正、仿真轨迹与真机失败而不让智能体朝狭窄或自生成的评估器优化。此外,本证据包为全文解析,但图表以文字描述形式呈现,具体曲线与逐版本数值仍需回到原文核对。

来源