冻结视频扩散模型Wan2.1的中间状态中可恢复运动信号,被解码为3D人体运动生成
相关研究与后续进展核心概要
该工作探究冻结的大规模文本到视频扩散模型是否隐含可显式提取的3D人体运动知识,通过探测Wan2.1发现其整个去噪过程的中间状态均存在可恢复的运动信号,并提出寄生协同去噪范式及其实现Parasitic Motion Decoder(PMD)——一个共享宿主噪声调度、经σ自适应多层融合读取宿主中间特征的流匹配解码器,在不修改宿主的前提下以远少于专用运动生成器的可训练参数在文本-运动对齐上领先,并单次生成配对的视频与运动。
Figure 1: Motion is decodable from a frozen video diffusion model at every step of its denoising trajectory. Cross-modal retrieval top-1 accuracy between the Wan2.1 video velocity and paired 3D motion at each noise level σ \sigma , against a held-out pool of 400 candidates (chance = 0.25 % =0.25\% ), compared with HY-Motion, a large-scale flow-matching model trained explicitly for 3D motion. (a) Frozen Wan2.1 retrieves motion at 24–31% across the schedule, two orders of magnitude above chance. (b) At every σ \sigma , Wan2.1 reaches 54–81% of HY-Motion’s accuracy, peaking at 81 % 81\% at σ = 0.9 \sigma=0.9 where the input is nearly pure Gaussian noise.
arXiv深度剖析
提出寄生协同去噪(parasitic co-denoising)范式:运动不是由独立生成器产生,而是沿宿主模型的去噪调度从宿主中解码出来。 相对于训练独立运动生成模型的常规做法,该范式把运动生成重新定义为对冻结视频扩散模型内部信号的解码,无需单独训练运动模型。 该范式由对冻结Wan2.1的探测结果支撑,探测显示可恢复的运动信号存在于整个去噪调度的中间状态,而非仅限于干净输出。
实例化为Parasitic Motion Decoder(PMD):一个高效流匹配解码器,共享宿主的噪声调度,并通过σ自适应多层融合读取宿主中间特征,宿主保持不修改。 与需要改动或重训宿主模型、或依赖运动数据训练专用生成器的方案相比,PMD以共享噪声调度和σ自适应多层融合的方式复用宿主特征,且不修改宿主。 摘要说明PMD为流匹配解码器,共享宿主噪声调度,经σ自适应多层融合读取中间特征,并保持宿主不变。
PMD在文本-运动对齐上领先专用运动生成器,且可训练参数仅为其一小部分,同时单次生成配对的视频与运动。 相对于仅生成运动的基线,PMD能在单次前向中同时产出视频与运动;相对于专用运动生成器,其覆盖能力来自宿主而非运动数据,参数效率更高。 摘要报告PMD在文本-运动对齐上领先专用运动生成器,可训练参数为其一小部分,并单次生成配对视频与运动,而仅运动基线无法做到。
启示与展望
该工作面向希望从已有大规模文本到视频扩散模型中提取显式3D人体运动的研究者与工程实践者,适用场景是宿主模型保持冻结、仅训练一个共享其噪声调度的轻量解码器。其价值在于以远少于专用运动生成器的可训练参数实现文本-运动对齐,并在单次生成中同时得到视频与运动,从而省去独立运动模型的训练流程。
摘要未给出文本-运动对齐的具体指标数值、PMD可训练参数的绝对规模、探测实验的量化细节,也未说明宿主模型之外的泛化验证。读者若关注这些量化证据,需查阅正文与实验部分。
