跳到主要内容
返回时间线
arXiv来源发表:

清华 Leap Lab 用匹配对照实验发现:世界动作模型的泛化来自推理时那一次前向,而非把未来去噪成清晰帧

核心概要

该研究在匹配骨干、数据与训练预算的受控条件下比较显式与隐式世界动作模型,发现隐式模型在分布内与显式模型相当(96.85 对 97.75),但在环境扰动、数据效率与任务泛化三个轴上全面落后,而把未来视频 token 保持在纯噪声、只做一次前向即可恢复大部分差距,据此提出 Simple-WAM,在保持隐式模型推理速度的同时取得领先显式模型的泛化表现。

AI-generated editorial illustration: What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling

深度剖析

研究提出一个三轴泛化评测框架,把世界动作模型的泛化拆成环境扰动、数据效率与任务泛化,并在同一骨干、同一数据、同一预算下比较显式与隐式两种推理范式。 此前关于“推理时是否需要生成未来”的争论,双方证据都来自各自系统、各自骨干与预算,且多在分布内采集;该工作把三个维度并排放进一个受控设置,只让“动作专家能否读到未来 token 表示”这一项变化。 对照实验使用 Wan2.2-5B 视频 DiT 与 B 规模动作专家,两种范式仅差一个结构化注意力掩码;扰动轴用 LIBERO-Plus 的七类变化,数据效率轴把每任务演示从 40–50 降到 10,任务泛化轴在 LIBERO 四个套件上做四折交叉验证。

隐式世界动作模型在分布内与显式模型相当,但在三个泛化轴上一致退化,说明推理时未来建模是要求而非仅是训练目标。 隐式范式此前报告的是“以极小代价取得接近显式范式的成功率”,该研究指出这种分布内持平不能推出泛化可比,并给出三轴上的具体落差。 表格数据显示分布内 96.85 对 97.75,扰动下 53.75 对 67.72,10-shot 下 88.50 对 96.95;任务泛化差距最大,无视频时 2.10 对 6.25,有动作无关视频时 5.90 对 69.90。

泛化收益几乎全部来自第一次去噪步:把未来视频 token 留在纯高斯噪声、只做一次前向,就能恢复大部分差距。 这挑战了“未来去噪得越清晰、策略越强”的直觉,也解释了显式范式的高成本为何并非必要——收益来自“准备未来”而非“生成未来”。 在显式范式训练好的模型上只改变推理时视频专家运行次数 K,K=1 时未来 token 为纯噪声,仍比隐式范式在四个设置上高出 26.0、8.9、8.0 与 67.7 个点;其后九次前向最多只再带来 0.6、0.6、0.6 与 0.6 个点。

据此提出的 Simple-WAM 在推理时对全噪声未来做单次前向,并在训练中用一个标量把流时间采样向该点倾斜,从而同时获得显式范式的泛化与隐式范式的速度。 与显式范式相比省去迭代去噪,与隐式范式相比保留未来 token 条件;不新增模块或损失项,只改推理前向次数与训练时的流时间分布。 在 LIBERO-Plus 七因子平均上取得 79.5,优于显式范式的 67.7 与隐式范式的 53.8;10-shot 下 LIBERO 97.2、RoboTwin 37.2;有动作无关视频时 LIBERO 73.6、RoboTwin 44.5;每动作块耗时 112 ms,显式范式 289 ms,隐式范式 98 ms。消融显示把噪声 token 换成可学习查询或零向量会使三轴平均从 94.2 降到 52.7 与 54.9。

启示与展望

该结果面向以视频生成模型初始化、用动作分块做语言条件操作的研究与工程设置:在 LIBERO、LIBERO-Plus、RoboTwin 2.0 仿真与 AgileX Aloha 双臂真机上,Simple-WAM 让策略在环境扰动、演示减少与留出任务三种部署变化下保留显式范式的泛化,同时把每动作块延迟压到接近隐式范式。对需要高频闭环控制、又希望从动作无关视频中获取新技能的团队,这提供了一条不新增模块或损失项的改造路径;对评测方,三轴协议可作为比较不同世界动作模型实现的公共框架。

结论建立在 B 规模、无具身预训练的骨干上,作者明确把“更大规模或带具身预训练时是否成立”留作开放问题。三轴协议中任务泛化在无视频设置下两种范式都接近地板(6.25 与 2.10),因此该轴的区分力主要来自有动作无关视频的情形。真机评测覆盖四个任务、每任务 30 次试验,并按子目标完成比例而非二值成功计分,逐任务标准差见附录。此外,本次读取的是论文正文与附录表格,图 1 至图 6 的具体曲线未在文本中展开,若需核对 K 扫描的逐点数值或真机任务示意,仍需回到原文图表。

来源