跳到主要内容
返回时间线
arXiv来源发表:

视频扩散模型为何违反物理:研究者定位到RoPE空间锚定效应,仅缩放RoPE频率即提升物理常识

核心概要

该研究对文本到视频扩散模型的“运动规划”过程做了可解释性分析,发现自注意力中RoPE引起的过度空间注意力衰减会让早期候选区域过早锁定到物理上不合理的位置,并据此提出一种仅在不同去噪步上缩放RoPE频率的轻量架构改动,在免训练与基于训练的实验中提升了生成视频的物理常识。

AI-generated editorial illustration: Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms

深度剖析

研究提出首个针对文本到视频扩散模型“运动规划”过程的可解释性研究,把“先形状、后细节”的经验发现推进到机制层面:以Wan2.1-T2V-1.3B和“篮球自由落体并反弹”为例,交叉注意力图在约第5步(共50步)由多个候选区域收敛为确定形状,并给出注意力熵与支撑质量两个量化指标。 此前工作已确立去噪早期确定空间布局的“先形状、后细节”规律,但未探究其形成机制;该工作从模型架构视角展开,把这一现象细化到注意力头与去噪步的层面。 基于单一主案例的逐层逐头可视化与两个自定义指标,并在其他案例与随机种子上报告结论在绝大多数场景成立。

研究用收敛速度与因果干预(归因修补、均值消融、零消融)区分交叉注意力头:只有少数呈现清晰轨迹模式的头真正影响运动规划,而轨迹模式清晰并非该头负责运动规划的必要条件;消融第三类头会使物体轨迹明显崩塌,消融第一、二类头则主要影响物体外观与背景等静态内容。 把“哪些注意力头负责运动”从观察相关性推进到因果干预层面的分类,并指出贡献值大不等于对轨迹的真实影响大。 以速度预测的修补指标与零消融后的生成视频质量作为证据,并在其他案例与随机种子上复现该分类。

研究指出自注意力的RoPE在空间维度上造成过度注意力衰减,形成“空间锚定效应”:某帧中较早稳定且物理上不合理的区域会通过该效应抬高相邻帧空间邻近区域的置信度,压制位置更合理但相对距离更大的候选区域,从而触发失败模式,例如篮球停在半空。 将物理不合理生成的根因归到自注意力中RoPE引起的空间衰减这一架构性因素,而非外部先验或数据不足。 以互一致性指标随去噪步与锚点距离的相关性增强、以及种子20失败案例中K1与K3置信度变化的可视化作为证据。

研究提出轻量RoPE修改:在不同去噪步上对RoPE频率施加不同缩放,以减弱空间衰减、鼓励模型在运动规划阶段探索更多候选区域;在VideoPhy的343个测试用例上以语义遵循与物理常识两项人工评测指标报告结果,训练式方法整体优于免训练与其他基线,优势主要体现在固体相关子集,且可与提示改写叠加。 相比引入物理模拟器、专门数据或外部基础模型的做法,该方法只改动一个缩放因子,保留原生可扩展性,并可与提示改写组合进一步提升物理常识。 免训练与基于训练(LoRA微调、自定义时间步采样器)两类设置,配合人工盲评;作者同时报告自动评测存在明显偏差,因此采用人工评测。

启示与展望

该结果面向研究文本到视频扩散模型内部机制与物理常识的研究者与工程团队,适用于以Wan2.1-T2V-1.3B/14B为代表、采用3D RoPE与DiT骨干的流匹配视频生成模型,且主要针对固体动力学这类轨迹易追踪的运动。方法在推理时只需在前5个去噪步应用RoPE修改,训练时配合自定义时间步采样器与LoRA微调;作者也说明该思路可延伸至图生视频与少步自回归扩散模型等更广场景,属于后续工作方向。

机制结论主要建立在单一主案例(篮球自由落体)与有限随机种子的可视化之上,作者称分类在绝大多数场景成立,但读者仍需关注更大规模案例与不同模型上的复现情况。效果评测采用VideoPhy的343个用例与人工盲评,作者指出自动评测的评判模型存在明显幻觉、与人工结果相关性低,因此不同评测协议下的数值可比性仍待观察。免训练设置需要人工调参缩放因子,作者也认为该方式难以规模化;可学习缩放因子的尝试未带来明显提升,说明当前架构与流匹配损失对物体运动轨迹的捕捉仍不充分。此外,本文为全文阅读,但正文中的图表以占位形式呈现,具体可视化细节需查阅原文与附录。

来源