DuoMatching用联合-边缘分布匹配提升少步视频生成,人类评测对全部基线总体偏好率超80%
核心概要
DuoMatching提出统一的联合-边缘分布匹配框架:在既有联合DMD之外,用图像生成模型对单帧边缘分布做直接监督,并以LatentBridge解决视频与图像隐空间不匹配、以Latent Variation Sampling把帧级监督分散到不同时间段;在因果与双向少步视频生成中提升了视觉质量、构图与语义对齐,同时基本保持运动动态,人类评测对全部基线的总体偏好率超过80%。
深度剖析
论文把少步视频生成中的分布匹配从单一联合匹配扩展为联合-边缘匹配:保留视频教师约束跨帧依赖,同时用图像教师对采样帧的边缘分布做直接监督,从而把图像模型的细粒度外观与语义先验迁移到视频学生。 既有DMD只用视频教师近似真实视频分布并匹配所有帧的联合分布,没有针对单帧的专门目标;论文指出这种联合匹配虽能缓解自回归展开中的漂移,但初始帧质量提升有限,并给出细粒度毛发与缺失羽毛等帧级不足的例证。 论文在附录C、D给出理想化分析:在边缘容量匹配的假设下,仅做边缘拟合的KL误差不大于联合拟合,且存在正的边缘权重使联合-边缘最优解在forward KL下更接近真实分布;主实验在VBench及自建400条挑战性提示上报告结果。
LatentBridge以轻量可微模块把时间压缩的视频隐变量映射到图像教师的帧级隐空间,使边缘DMD可以直接作用于视频学生,而不必解码再编码。 直接对时间压缩的视频隐变量施加边缘DMD虽能提升语义与视觉质量,却会抑制隐变量中编码的动态信息;解码-再编码方案在训练配置下内存溢出。 消融显示LatentBridge在提升语义与成像质量的同时基本保留动态,显存开销仅略高于直接方案;附录E说明该模块为8个FiLM残差块、256隐藏通道、约10.75M可训练参数,在29,400个480p视频上训练3,000步约15分钟(8张80GB GPU)。
Latent Variation Sampling按相邻隐变量切片的均方差异选取变化最大的位置并切分时间段,每段采样一个切片施加边缘DMD,把有限的帧级监督预算分散到不同时间区域。 均匀随机采样容易集中在变化缓慢的区域,产生冗余监督并可能因过度强调近静态内容而抑制运动。 消融中采样切片数从较少增至中等时总分提升,继续增加则动态与总分下降;LVS在所有测试的采样数下优于均匀采样,并在相同设置下优于时间分层采样。
在因果与双向两类少步生成设置中,DuoMatching在匹配的生成模式与NFE预算下取得更高的VBench总分,且不增加推理计算。 因果设置覆盖1步、2步与4步分块生成,双向设置以CausVid的双向DMD变体为主要基线;改进集中在视觉质量与语义对齐,运动质量大体保持。 表1报告各模式与NFE下的语义、美学、成像、动态、平滑度与总分;人类评测采用2AFC协议,23名参与者各评40对提示匹配视频,对全部基线的总体偏好率超过80%,视觉质量与语义对齐偏好率更高,时间与运动偏好率接近或高于持平。
启示与展望
该框架面向少步视频生成,尤其是自回归/因果流式生成,也扩展到双向生成;其收益来自图像教师提供的帧级先验,因此适用于能够获得强图像生成模型并愿意承担一次LatentBridge预训练成本的团队。论文默认设置使用Qwen-Image作为图像教师,输出为特定帧数与分辨率的视频,训练在8张80GB GPU上完成;边缘权重与采样切片数存在使视觉质量与动态平衡最佳的取值区间。
论文的联合-边缘改进分析建立在理想化假设之上,包括边缘容量匹配、正密度与可微性等条件,实际训练偏离这些假设时的行为仍需观察。人类评测为23人、每人40对视频的2AFC结果,偏好率的具体置信区间未在正文给出。LatentBridge的重建质量与损失传递分析在附录中给出,其在不同视频VAE与图像教师组合下的泛化程度仍是开放问题。此外,边缘权重过大时动态得分明显下降,说明质量与运动的平衡对超参数敏感。
