WorldPlay2 用因子化混合控制接口与压缩记忆+稳定蒸馏,在 WBench 上把平均分推到 83.1 并在 RevisitBench 上把 MEt3R 降到 0.105
核心概要
WorldPlay2 是一个实时交互式世界模型,它把帧对齐的动作控制与解耦场景、角色身份和动态语义事件的结构化语义控制组合成因子化混合控制接口,并把历史上下文压缩成自回归学生与双向教师共享的记忆 token,配合由少步初始化与全 rollout 回放构成的 Stable Forcing 蒸馏,在 WBench 上取得 83.1 的平均分(高于 Alaya-Evoke-Turbo 的 82.0),在 RevisitBench 上把 PSNR 提到 19.71、MEt3R 降到 0.105,并在 8 张 H20 GPU 上实现 16 FPS 的实时生成。
深度剖析
提出因子化混合控制接口,把低层运动与高层语义交互、视觉内容因素显式解耦:帧对齐动作控制处理连续相机俯仰/偏航、离散纵向与横向移动、相机视角和跳跃动作,结构化语义控制则把信号分成场景、角色、事件三个字段。 此前工作多以相机位姿、离散键盘输入或像素坐标场控制视角与角色移动,语言驱动事件虽被引入,但异构控制信号仍难以统一表示;该工作把不同语义粒度与时间跨度的控制显式分离,使模型能学习跨异构控制的可复用组合。 论文给出接口的公式化定义与注入位置(在 Transformer 每个块的 FFN 之前),并报告消融:去掉结构化语义控制后旋转误差从 0.168 升至 0.478、平移准确率从 98.3 降至 88.9,说明解耦对导航可控性有可测影响。
把生成历史压缩为紧凑记忆 token,由自回归学生与双向教师共享,从而把长 rollout 切成以记忆为条件的局部片段分别打分,避免联合处理整段长 rollout。 既有方法常保留全分辨率上下文或依赖检索、稀疏注意力、显式 3D 表示来维持长时一致性,并把蒸馏当作独立模块;该工作把记忆与蒸馏协同设计,使教师评分在长时程下仍可计算。 论文报告压缩使序列长度约降低一个量级,并在 96 latents 训练下与全上下文基线取得相近的长时几何一致性(PSNR 18.80 对 18.47,MEt3R 0.128 对 0.133),同时显著降低显存与迭代时间。
提出 Stable Forcing 长时程蒸馏框架:先用受 PDD 启发的少步初始化让自回归学生产生有意义的少步 rollout,再用全 rollout 回放把长时程 rollout 与梯度反传解耦,每个 chunk 做完整少步采样并缓存一个随机中间去噪时间步用于带梯度回放。 Self Forcing 类方法在长时程下会因误差累积与少步采样导致学生分布偏离教师、训练不稳定;该工作把初始化与回放结合,使长时程分布匹配蒸馏保持稳定。 消融显示去掉初始化与全 rollout 回放后 WBench 平均分降至 73.9 并出现模式崩溃与地面伪影,仅保留回放为 75.2,完整方法为 83.1;全上下文教师虽性能接近(82.3)但每次迭代耗时 261s 对 167s,且扩展到 320 latents 时出现显存不足。
在 WBench 与自建 RevisitBench 上系统评测:WorldPlay2 平均分 83.1,超过此前最优基线 Alaya-Evoke-Turbo 的 82.0;RevisitBench 上 PSNR 19.71、SSIM 0.613、LPIPS 0.318、MEt3R 0.105,均优于五个对比模型;交互事件评测平均分 74.7(EO. 79.2、CI. 70.1)。 对比模型分别受限于固定上下文窗口的记忆退化、相机位姿漂移导致的检索失准、显式 3D 表示的跨 chunk 尺度歧义或时间闪烁;该工作在不依赖易错检索与敏感显式 3D 表示的情况下维持长时几何一致性。 评测覆盖 WBench 导航划分与 200 条回访轨迹的 RevisitBench,并用 VLM 自动评估 145 个留出样本的指令遵循与执行准确度;训练语料为 700K 导航片段(30s–60s)与 10K 交互事件片段(10s–30s)。
启示与展望
该结果面向需要实时响应、多轮交互控制与长时几何一致性的交互式世界模型场景,例如导航式探索与语义事件驱动的环境演化。论文给出的训练配方为多阶段课程:先在空间导航数据上训练基础视频扩散模型,再按两阶段流程接入记忆压缩器,随后用教师强制把双向模型转为 chunk 级自回归模型并经 PDD 少步初始化,最后做分布匹配蒸馏;推理侧通过计算图融合、低比特量化、KV 缓存与轻量 VAE 在 8 张 H20 GPU 上达到 16 FPS。对读者而言,这意味着该工作提供了一套可复用的“控制接口 + 压缩记忆 + 稳定蒸馏”组合,适合被后续工作在更长时程、更多控制类型与更大数据规模上继续扩展。
论文自述角色仍会出现渐进的视觉与语义漂移,偶尔无法在长 rollout 中保持严格身份一致性;扩展到无限时程生成仍是开放挑战,如何在无误差累积的前提下同时维持无限 rollout 稳定性与长期几何一致性尚未解决。评测方面,交互事件响应依赖 VLM 作为自动评估器,其评分与人类判断的一致性未在文中展开;RevisitBench 由 50 条 10s 与 150 条 30s 回访轨迹构成,规模有限。此外,实时 16 FPS 的结论绑定在 8 张 H20 GPU 与特定推理优化组合上,换用其他硬件或未启用同等优化时表现如何,属于需要进一步观察的问题。
