跳到主要内容
返回时间线
arXiv来源发表:

AnyStep-WAM 用冻结教师轨迹蒸馏与风险收益调度,把三个世界动作模型的去噪步数削减约五成至八成半并保持成功率

核心概要

该工作提出 AnyStep 世界动作模型框架:用冻结教师轨迹构造的区间目标做预算对齐的流图蒸馏,并训练一个轻量风险—收益调度器,从单次一步预览预测教师轨迹难度与各预算下的学生保真度,从而为每个动作块选择满足保真要求的最小去噪预算;在 RoboTwin 2.0 上对 Motus、FastWAM、LingBotVA 三个骨干分别减少平均去噪步数 60.2%、49.8%、85.28% 且平均成功率与全预算基线相差不超过 0.24 个百分点,同时把一步预算下的成功率分别提升 7.07、12.08、8.94 个百分点,并在六项真实机械臂任务上取得 1.67–6.14 倍的单次推理加速。

AI-generated editorial illustration: AnyStep-WAM: Budget-Aligned Distillation and Adaptive Inference for World Action Models

深度剖析

提出预算对齐的积分流图蒸馏:从冻结教师轨迹上取有限区间位移作为监督目标,并按候选推理调度采样训练区间,使同一个模型能在一步预测到多步细化之间切换。 此前的少步/任意步方法(如 MeanFlow、AnyFlow)依赖对演化中学生的导数或有限差分监督,本文改用与冻结教师端点绑定的积分目标,并让训练区间与推理调度对齐。 论文报告有限差分目标样本分布更宽、梯度频繁出现尖峰,而冻结教师目标更集中、梯度更稳定;消融中移除区间监督后两步成功率从 86.21% 降至 78.94%,自适应成功率从 87.96% 降至 78.09%,平均预算从 3.98 升至 5.27 步。

提出风险—收益自适应推理:用教师轨迹的速度变化作为难度代理,用离线评估得到的各预算学生—教师一致性作为保真度代理,由轻量调度器从单次一步预览同时预测两者,选择满足难度相关保真阈值的最小预算。 已有自适应方法多依据输入调整计算量,但未同时刻画教师去噪难度与学生在该预算下的保真度;本文把预算选择表述为风险—收益决策问题。 在 RoboTwin 上,调度器相对训练无关的百分位门控基线在 Motus、FastWAM、LingBotVA 上平均成功率分别高 0.70、1.43、1.88 个百分点,同时平均去噪步数再降 21.8%、24.5%、23.5%;阈值上下浮动五个百分位点时成功率仍在 Full 的 0.36 个百分点以内。

提出单预览复用执行:一步预览既用于预算选择,又被重新加噪后接入所选调度,因此不需要额外去噪过程、在线教师评估或候选轨迹回放。 相比需要在线评估多个候选预算的做法,该设计把调度开销压缩为轻量预测,并让预览计算不被浪费。 论文报告预算选择模块每次预测开销仅 2.881、2.4996、2.9772 毫秒;在单张 A100 上平均单次推理延迟从 1.932 秒降至 0.859 秒(Motus)、0.496 秒降至 0.295 秒(FastWAM)、9.732 秒降至 3.247 秒(LingBotVA)。

在三个 WAM 骨干与真实机器人上验证:蒸馏提升一步预算下的成功率,自适应推理在保持或提高平均成功率的同时大幅减少步数与延迟。 论文称据其所知此前尚无工作专门针对流图训练的 WAM 做自适应预算选择,且该验证覆盖联合视频—动作与仅动作两类推理形式。 RoboTwin 上一步预算成功率相对 Base 提升 7.07、12.08、8.94 个百分点,并超过 Flash-WAM 3.19、7.58、1.30 个百分点;真实机器人六项任务平均成功率升至 69.17%、71.67%、70.00%,平均去噪步数下降 59.4%、63.9%、85.84%,单次调用延迟从 1.868 秒降至 1.117 秒、0.280 秒降至 0.122 秒、4.654 秒降至 0.758 秒。

启示与展望

该结果面向使用流匹配式去噪分支的世界动作模型,适用于机器人操作这类动作块精度需求随阶段变化的场景;论文在 Motus、FastWAM、LingBotVA 三个骨干上验证,覆盖 RoboTwin 2.0 的 50 项双臂任务与六项真实任务(Bowl Pouring、Clean Table、Put Block、Put Cup、Stack Blocks、Stack Bowls),真实平台为 Unitree G1D 双臂机器人配 Dex1-1 夹爪。对希望降低推理延迟的部署方,可直接沿用其候选预算集合与共享 LoRA 适配方式;对研究自适应计算的读者,其风险与保真度分离建模的思路可迁移到其他迭代生成策略。

风险与保真度都被论文明确称为代理量,而非任务失败概率或终端动作误差的直接度量,因此调度器预测与真实任务结果之间的关系仍是需要继续观察的问题。真实机器人实验每任务平均 20 次试验、每任务 50 条演示,样本规模有限;论文也指出调度器在仅用干净样本训练时仍接近完整训练的表现,但这一泛化结论的适用范围有待更多环境验证。此外,加载文本为完整正文,但部分表格与图(如 Figure 3、Figure 5、Figure 6 及若干附录表)以引用形式出现,其具体数值未在文本中展开,若需逐任务细节仍需查阅原文图表。

来源