跳到主要内容
返回时间线
arXiv来源发表:

WorldLine 用一万小时无动作视频预训练、两千小时跨十种本体动作轨迹接地,在失败轨迹上把机器人掩码 IoU 提升 0.1626,并以 74% 平均准确率预测轨迹成败

核心概要

WorldLine 提出一种动作驱动的视觉模拟器,把可迁移的机器人—物体动力学学习与异构动作接地解耦:先在超过 10,000 小时无动作机器人视频上预训练,再用超过 2,000 小时、跨十余种本体的动作轨迹通过图像空间动作图接地,并配合多视角、失败样本与关系正则化训练,最后用机器人聚焦的少步蒸馏实现因果 rollout;在留出与域外设置下保持视觉质量与机器人运动一致性,失败轨迹上机器人掩码 IoU 比最强基线高 0.1626,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败,并在未用 RoboTwin 训练或适配的情况下把任务成功率最多提升 21.4 个百分点。

AI-generated editorial illustration: WorldLine: Action-Driven Visual Simulation for Robotic Manipulation

深度剖析

WorldLine 把动力学学习与动作接地拆成两阶段:Stage I 在超过 10,000 小时、来自六个集合、覆盖十余种本体与 3,500 多个操作任务的无动作机器人视频上适配预训练视频模型,Stage II 再用超过 2,000 小时、跨十余种本体的动作轨迹学习控制如何驱动未来运动。 既有动作条件模拟器多把视觉动力学与动作语义从同一批动作标注轨迹中联合学习,使模拟覆盖受限于稀缺的动作监督;WorldLine 让无动作视频与本体特定动作轨迹提供互补监督。 论文给出数据规模与来源(AgiBotWorld、RoboCOIN、RoboMIND 系列、Galaxea 等),并在匹配总训练算力的消融中显示移除无动作数据会同时降低视觉质量与规划表现,作者据此把差异归因于交互覆盖而非额外优化。

WorldLine 用图像空间动作图作为跨本体共享控制接口:把末端执行器位姿与夹爪状态投影到每个相机视角,形成九通道动作图,与视频潜变量在时空上对齐后加入 DiT。 原生动作向量受本体运动学与坐标系限制、难以跨本体共享,潜动作需要额外接地;图像空间表示保留动作几何,使不同控制空间可以共用同一条件接口。 消融中把图像空间动作图替换为 FiLM 注入的原生动作向量后,机器人 IoU、LPIPS 与两种策略下的规划成功率一致变差;在匹配 RoboTwin 训练与 32 条 rollout 预算下,WorldLine 优于同为投影式编码的 GE-Sim-V2 与 Masked Visual Actions。

WorldLine 通过同步多视角、约 200 小时失败轨迹与基于冻结 V-JEPA2 的关系正则化提升交互敏感预测,并用机器人聚焦的四步因果蒸馏把采样从 35 步降到 4 步。 单相机可能漏掉夹爪—物体接触,成功样本偏多的数据会低估失败结果;关系正则化显式约束时间与跨视角关系,蒸馏则在保留动作关键运动的前提下支持在线更新与低延迟 rollout。 消融显示仅用头视角会降低机器人掩码重叠,仅用成功轨迹对一种策略几乎无影响却使 LingBot-VLA 成功率下降 10.8 个百分点,移除关系正则化主要影响视觉质量与几何一致性;蒸馏把 129 帧生成从 90 秒降到 21 秒、每帧从 0.698 秒降到 0.163 秒。

在动作条件生成、策略评估与具身规划三类评测中,WorldLine 在留出与域外设置下保持视觉质量与机器人运动一致性,失败轨迹上机器人掩码 IoU 比最强基线高 0.1626,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败,并在未用 RoboTwin 训练或适配的情况下把任务成功率最多提升 21.4 个百分点。 这些结果把视觉模拟器从“看起来合理”推进到可用于候选动作排序与策略评估,且跨未见环境与本体仍成立。 评测使用场景不相交的 AgiBotWorld 划分与完全域外的 DROID,DROID 不参与训练、适配或检查点选择;规划实验固定策略检查点、共享候选轨迹,并用 Qwen3VL-8B 在隐藏候选身份的条件下选择,报告五次独立采样候选库的标准差。

启示与展望

这项工作面向需要在物理执行前预测动作后果的机器人学习场景:策略开发者可以用它评估候选行为、做 best-of-n 轨迹选择,并在不接触目标平台数据的情况下获得跨本体 rollout。它适用于具备相机标定与机器人运动学、能提供初始观测与动作序列的设置;论文明确把 RoboTwin 与 DROID 排除在训练、适配与检查点选择之外,因此其域外结论针对的是未见环境、相机配置与本体。四步因果蒸馏版本面向低延迟在线更新与长时程 rollout,作者也提出把它用作强化学习环境与测试时扩展工具。

读者仍需关注几点:规划收益受底层策略提出的候选轨迹多样性与多模态选择器质量限制,作者也指出 Qwen3VL-8B 并不完美,候选不保证单调增益;少步蒸馏并非均匀降质,而是改变哪些任务相关线索在 rollout 中保留,在结果视觉上可区分时更有用、在需要细微差异排序时可靠性下降,是否用节省的算力评估更多候选来抵消排序误差仍是开放问题;失败案例显示域外 DROID 上仍会出现严重场景畸变与模糊、动作错位与交互结果不一致;罕见操作模式、可变形物体、非常规相机配置与更长动作时域可能需要更广的针对性监督。此外,本证据包为全文解析,但图表与部分附录细节以引用形式出现,具体数值表与定性对比图未逐项展开,若需核对个别数字仍应回到原文。

来源