跳到主要内容
返回时间线
arXiv来源发表:

CrossBFM 把 Unitree G1 的行为潜空间蒸馏到三款人形机器人,训练不到一 GPU 小时且跟踪仅差 0.025 弧度

核心概要

CrossBFM 冻结在 Unitree G1 上预训练的 Behavior Foundation Model 的 backward map,利用重定向数据提供的逐帧跨本体对应关系,用一个无机器人专属参数的统一编码器把该潜空间蒸馏到 Inhouse M3、Booster T1、Fourier N1 三款人形机器人上,编码器训练不到一 GPU 小时、每个跟踪器再加约 10 GPU 小时,三种提示模式(动作跟踪、目标姿态到达、奖励优化)均可迁移,潜条件策略相对关节条件策略仅损失 0.025 弧度,用四分之一动作语料只损失 5% 跟踪性能,在未见过的形态相近机器人上最多恢复 89% 的跟踪性能,并在真机上验证。

AI-generated editorial illustration: CrossBFM: Distilling a Shared Latent Behavior Space Across Humanoid Embodiments

深度剖析

提出一个无机器人专属参数的统一编码器,把冻结源 BFM 的 backward map 蒸馏到多个本体上,一次训练同时处理所有训练机器人。 此前 BFM-Zero、UFO 等框架每个机器人需要单独训练一次,单次超过 100 GPU 小时,且第二次训练产生与第一次无关的潜空间;CrossBFM 把潜空间本身当作可迁移资产,用固定宽度输入(8 个关键体索引、33 个规范关节槽位、缺失槽位用二值掩码加零填充)让不同自由度与拓扑的机器人共用同一网络。 论文报告编码器训练在单张消费级 GPU 上不到一小时,跟踪器按常规 PPO 训练约 10 GPU 小时;附录给出统一编码器约 M 参数、每机器人编码器各约 M 参数,并报告统一编码器在三个新机器人之间的潜空间一致性高于分别训练的每机器人编码器。

把重定向数据当作跨本体对应关系的“oracle”,使目标侧的潜空间学习退化为对冻结源潜变量的监督回归。 以往跨本体工作要么用本体描述条件化单一任务策略,要么用最优传输或图匹配显式对齐状态空间;这里直接利用同一时间轴上逐帧对齐的重定向动作,把对应关系交给重定向算法,从而在目标侧去掉模拟器、强化学习训练和对抗目标。 训练目标为逐帧余弦回归到冻结源潜变量,编码器采用 pre-LayerNorm transformer 与因果注意力掩码;附录的扰动实验显示,时间偏移可通过一维相位搜索精确恢复,非系统性高斯噪声在推理时约 0.1 弧度、训练时约 0.2 弧度内可容忍,而系统性偏置在约 0.1 弧度内无害、到 0.3 弧度则明显破坏对齐与跟踪。

潜条件跟踪器在三个蒸馏人形机器人上覆盖 BFM 的全部三种提示模式,性能接近关节条件策略。 关节条件策略每步都能拿到精确关节角,天然是跟踪任务的上界;潜条件策略只给一个行为潜向量,却仍能跟踪动作、在姿态间平滑到达目标且无摔倒,并完成全部 41 个奖励提示的优化。 论文报告潜条件相对关节条件仅损失 0.025 弧度;目标到达只在潜条件策略上报告,因为关节条件策略在关节目标跳变时会产生大扭矩并提前终止;奖励优化中,用源机器人真实 backward map 在 M3 和 N1 上反而比 CrossBFM 更差,原因是奖励加权投影取决于执行机器人实际可达的状态集合。

蒸馏对数据量和机器人数量都表现出可扩展性:四分之一语料足够,形态相近的未见机器人可部分泛化。 这给出了一条降低蒸馏成本的实证路径,并指出跨本体泛化更接近插值而非外推:当新机器人在训练集中有形态近亲时表现更好。 随机选取占 LAFAN 语料四分之一的连续片段训练编码器,关节 MAE 从全量时的约 0.05 弧度升到约 0.06 弧度,跟踪性能只损失 5%,性能在约 10% 数据时才明显崩溃;在三个机器人中留一训练时,从未见过 M3 的编码器恢复约 89% 的跟踪性能,而未见过的 T1 只恢复约 60%,论文将其归因于 T1 形态差异更大、在训练集中没有近亲。

启示与展望

该结果面向已有冻结源 BFM 且能获得逐帧对齐重定向动作的人形机器人平台:编码器训练不到一 GPU 小时,每个机器人的潜条件跟踪器约 10 GPU 小时,新增机器人只需一份名称映射与尺度常数这类配置文件,而不需要额外训练或改架构。它使同一潜向量可同时指挥多个本体,并支持用流式生成模型在共享空间内采样行为,从而把提示从关节空间参考扩展到行为模式乃至文本等更宽的提示形式;论文也把更丰富的训练数据以获得更细粒度行为空间、以及更大的机器人训练集以改善对未见机器人的泛化列为后续方向。

论文正文中的若干表格数值在本次加载的文本里以空白或占位形式出现,因此跟踪 MAE、目标到达 MAE、奖励优化对比、数据缩放曲线与留一机器人表格中的具体数字只能依据摘要与正文叙述转述,无法逐格核对。跨本体泛化目前只在形态相近的机器人上得到验证,论文指出当新机器人在训练集中没有近亲时潜相似度明显下降,因此把泛化扩展到形态差异更大的本体、以及把行为空间扩展到更细粒度与更长时程的 loco-manipulation,仍是待观察的方向。真机验证覆盖 M3 与 T1 两款机器人,论文提到存在小幅 sim-to-real 退化,其在不同硬件与任务上的幅度值得继续跟踪。

来源