跳到主要内容
返回时间线
arXiv来源发表:

InternW0-Δ 用 2 万余小时异构数据预训练世界动作模型,在 LIBERO-Plus 达 92.8%、RoboTwin 2.0 Clean2Random 达 71.9%

核心概要

InternW0-Δ 把预训练视频专家与动作专家通过有向 Mixture-of-Transformers 耦合,用冻结 VLM 提供场景语义、用 Causal Imprint 从训练期未来监督中学习与未来相关的场景变化、用 Track4World 教师做仅训练期的 4D 几何与运动蒸馏,并在机器人演示、UMI、自我中心人类演示与 Ego2Robot 数据统一为规范状态-动作表示后构成超过 2 万小时语料上预训练,在 LIBERO-Plus 取得 92.8%、RoboTwin 2.0 Clean2Random 取得 71.9%、EBench 总分 66.0、RoboDojo 平均成功率 23.91%,并在四类真机平台(两种夹爪、两种灵巧手)上完成部

AI-generated editorial illustration: InternW0-Δ: A World Action Model Bridging Predictive Dynamics and Actions with 20K+ Hours of Open Data

深度剖析

提出有向的世界-动作 Mixture-of-Transformers:预训练视频专家与动作专家各自保留模态参数,仅通过掩码联合注意力交换信息,冻结 VLM 向动作专家提供场景语义,训练期未来观测只作为监督而不进入动作预测的前向路径。 相较此前 WAM 需要测试时生成未来视频或依赖未来帧输入,这里把未来信息限制在训练监督中,使推理时无需采样未来视频即可直接输出动作。 论文给出注意力掩码设计、训练目标(视频与动作流匹配、Causal Imprint 两项损失、蒸馏 MSE)与推理流程描述;消融显示在 LIBERO-Plus 上从基线 49.59% 逐步加入稀疏记忆、VLM、Causal Imprint 与表示对齐后升至 76.45%。

Causal Imprint 用可学习 token 从锚点、近期与当前观测中编码未来相关场景变化,并以相邻干净潜变量差分和与未来视频特征的表示对齐作为训练监督。 把“预测未来”转化为“把未来监督压印到当前可用的表示上”,使动作专家获得预测性表示而不接触已实现的未来帧。 消融中单独加入 Causal Imprint 使 LIBERO-Plus 成功率由 69.08% 升至 70.80%,再加入表示对齐升至 76.45%;论文说明未来观测仅用于构造监督目标。

构建并统一超过 2 万小时的异构语料:机器人演示、UMI 数据、自我中心人类演示与 Ego2Robot 数据被映射到 80 维规范状态-动作空间,并经过信号一致性、静态边界裁剪、视觉质量、动作幅度、指令正确性与视频-指令一致性等过滤。 论文称这是同类中最大的开源语料,并给出过滤前后的小时数与回合数统计以及 Ego2Robot 转换覆盖统计。 过滤后机器人数据为 11,302.20 小时、1,247,656 个回合;EgoDex 与 EgoVerse 保留 4,061.35 小时;Hy-UMI-10K 保留 2,075.42 小时;Ego2Robot 转换覆盖 1,101.55 小时并产出 5,633.77 机器人小时。

在四个仿真基准与四类真机平台上验证同一预训练检查点经后训练适配不同本体与控制接口,并给出训练与部署基础设施优化。 同一检查点分别适配夹爪与灵巧手接口,并报告异步执行下的往返延迟与训练吞吐加速。 LIBERO-Plus 92.8%、RoboTwin 2.0 Clean2Clean 90.0% 与 Clean2Random 71.9%、EBench 总分 66.0、RoboDojo 平均成功率 23.91%;灵巧手部署在单张 RTX 5090 上平均往返延迟 152.8 ms;LIBERO 与 RoboTwin 上端到端训练吞吐分别获得加速。

启示与展望

该工作面向通用机器人操作,适用于需要跨本体、跨任务分布迁移的策略学习场景:预训练语料覆盖机器人演示、UMI、自我中心人类演示与 Ego2Robot 数据,后训练阶段把同一检查点适配到 LIBERO-Plus、RoboTwin 2.0、EBench、RoboDojo 以及 AC-One、Arx5、Franka+XHand、TianJi Marvin+Wuji Hand 四类真机平台。对希望复用其数据配方、规范状态-动作表示或部署优化的团队,论文承诺在许可允许范围内开源训练代码、模型权重、基础设施、数据处理管线与处理后数据,并给出带版本索引的过滤记录。

自我中心人类演示的贡献尚未被系统研究,论文自述未考察不同数据来源、转换策略、缩放比例与监督形式的影响;智能体辅助控制只做了小规模探索,未系统研究调用策略、长程规划与分层决策。数据来源消融结果限定在当前数据规模与以夹爪操作为主的评测设置下,作者提示不应据此推断自我中心数据对表示学习无益。真机任务中部分任务的评测回合数有限,跨任务与跨本体的稳定性仍需更多验证。此外,本次读取为全文,但公式与表格在文本中以占位形式呈现,具体数值细节以原文表格为准。

来源