跳到主要内容
返回时间线
arXiv来源发表:

Rolling-WAM 把联合去噪摊到多个重规划周期,在 LIBERO 达 98.1%、RoboTwin 2.0 达 93.3%,并相对标准联合 WAM 取得 4.5 倍稳态重规划加速

核心概要

Rolling-WAM 提出一种滚动式世界动作模型:在滑动窗口内维持处于不同噪声水平的视频-动作块,每个重规划周期只把即将执行的动作块完全去噪、同时部分精修更远的未来块,从而把联合去噪计算分摊到多个控制周期;在 LIBERO、RoboTwin 2.0 与 Unitree G1 真机人形任务上取得有竞争力的操作成功率,并相对标准联合 WAM 实现 4.5 倍稳态重规划加速。

AI-generated editorial illustration: Rolling-WAM: World Action Models with Rolling Imagination

深度剖析

论文把世界动作模型(WAM)的推理瓶颈定位为:每个重规划周期都要从纯噪声开始对整个预测时域做联合视频-动作去噪,导致推理延迟并拖慢闭环响应。 此前已有做法在部署时干脆去掉未来视频生成(Fast-WAM)或缓存未来上下文,而 Rolling-WAM 选择保留未来想象、只改变去噪在时间上的组织方式。 论文以问题形式化(Sec. III-A)与延迟测量支撑这一判断:在单张 NVIDIA A100、RoboTwin 2.0 设置下,Joint-WAM 每次更新 978 ms、Fast-WAM 548 ms,而 Rolling-WAM 为 215 ms。

核心方法是滚动式视频-动作去噪:窗口被切成时间对齐的块,越靠未来噪声水平越高;每个周期只让最近的一块变干净,其余块保留并继续去噪,窗口随新相机观测前移并追加一个高斯噪声新块。 作者把序列生成中的 rolling diffusion 思路扩展到联合视频-动作建模,让动作 token 通过注意力看到整个预测窗口内部分去噪的视觉未来,而动作块之间不直接互相注意。 方法由滚动模式与初始化模式两套噪声调度(式 2、式 4)、Euler 更新(式 5)与流匹配训练目标(式 6–8)给出;消融显示允许跨块动作注意力反而降到 76.3%(选定 RoboTwin 任务)与 97.9%(LIBERO),低于仅块内注意力的 78.2% 与 98.1%。

在仿真基准上,Rolling-WAM 以每个重规划周期仅两步去噪取得有竞争力的成功率:LIBERO 平均 98.1%,RoboTwin 2.0 平均 93.3%。 LIBERO 上 98.1% 与并列领先的 LingBot-VA、Joint-WAM(均 98.5%)相差 0.4 个百分点,高于 Motus(97.7%)与 Fast-WAM(97.6%);RoboTwin 2.0 上 93.3% 的平均成功率高于 LingBot-VA(92.2%)、Fast-WAM(91.8%)与 Joint-WAM(90.6%)。 LIBERO 覆盖 Spatial、Object、Goal、Long 四个套件,每任务 50 次 rollout;RoboTwin 2.0 覆盖 50 个双臂任务,Clean 与 Randomized 两种设置各 100 次 rollout,并给出逐任务结果表。

在真机 Unitree G1 人形上,单一策略跨三个任务取得 85.0% 平均成功率,高于 Joint-WAM 的 78.3% 与 Fast-WAM 的 75.0%。 论文把滚动去噪从仿真推进到真实人形操作,并报告在 Bead Pouring 上取得最高的 70%,在 Doll Placement(85%)与 Plate Stacking(100%)上与最强基线持平。 三个任务(Doll Placement、Plate Stacking、Bead Pouring)各 20 次试验,每任务 50 条 10 Hz 演示,动作以 10 Hz 执行;作者同时给出定性观察,称 Joint-WAM 下停顿更明显并有时打断任务进程。

启示与展望

这项工作面向需要在动态环境中反复重规划的机器人操作场景:语言条件下的仿真操作(LIBERO、RoboTwin 2.0)与 Unitree G1 人形真机任务。它适用于希望保留显式未来视觉预测、又不愿每周期从头去噪整个预测时域的部署者,并且论文指出该思路与其他 WAM 效率技术正交、可以组合以进一步降低推理延迟。默认配置为每块 16 步去噪、窗口 5 块、每块 16 个动作,稳态每周期只需两步;延迟测量在单张 A100 上完成,未使用 torch.compile、TensorRT 或自定义 CUDA 内核。

论文自述的开放问题包括:窗口与块大小等设计选择需要在不同动力学与控制频率的任务设置中进一步探索;尽管有观测反馈,保留的预测仍可能滞后于快速场景变化并误导动作生成,长窗口下尤其如此,自适应窗口管理与异步执行被列为改进方向。消融还显示更大的窗口并不稳定提升性能(选定 RoboTwin 任务上窗口 5 为 78.2%,窗口 8 为 69.5%),作者推测更远的视觉预测受当前观测约束更弱。此外,训练噪声混合的替代方案没有同时改善两个基准:Random 在选定 RoboTwin 任务上把成功率提到 78.5%,但 LIBERO 降到 97.3%。

来源