首篇视频生成后训练与对齐综述把四类方法收进统一框架,并给出跨基准的维度化证据
核心概要
这篇发表于 TMLR 的综述首次系统梳理视频生成模型的后训练与对齐,把方法按对齐信号如何被施加分为隐式与显式两类,并归入监督微调、自训练与蒸馏、偏好与奖励优化、推理时方法四大类,同时整理常用数据集、基准与评测实践,并讨论可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡以及安全生成等开放挑战。
深度剖析
综述提出以“对齐信号如何被施加”为轴心的统一框架,把后训练定义为大规模预训练之后、不从头重训即可改变模型行为的优化、适配或控制过程,并据此区分隐式对齐与显式对齐。 此前综述多按架构或条件信号组织,如视频扩散模型总览、可控视频生成综述、以人为中心的视频生成综述;本文改按对齐如何被强制执行来组织,作者称其为该方向首篇综合性综述。 属于概念性框架贡献,依据是对文献的分类与定义,而非实验测量;文中明确说明隐式与显式对齐是一条谱系而非严格二分。
综述把方法归为四类:监督微调、自训练与蒸馏、偏好与奖励方法、推理时方法,并指出四类并非互斥,现代系统常按顺序组合多个阶段。 文中给出跨家族组合的具体模式,例如先监督微调再偏好优化、先蒸馏再奖励微调、以及监督微调加视频特定奖励的强化学习再加多阶段蒸馏的流水线。 依据是对大量代表性方法的归类与流程描述,并配有汇总表格列出各方法的子类别、阶段数、基座模型、GPU 规模、发表venue与年份。
综述系统整理了后训练数据集、按对齐维度划分的基准与评测协议,并汇总了 VBench、VBench2、VideoPhy、VideoPhy2 上的报告结果。 作者强调这些数字是异构协议下的基准级证据而非统一排行榜,并指出同一基准下不同方法可能使用不同提示集、子指标或评测子集。 表格覆盖监督微调、自训练与蒸馏、偏好与奖励、推理时四类方法在时序一致性、视觉质量、主体一致性、可控性、物理合理性等维度上的报告分数,缺失项表示原文未报告。
综述指出后训练常优化特定行为维度,某一维度的提升可能暴露或放大另一维度的弱点,例如时序平滑度高并不必然意味着动态程度强。 这一诊断视角把基准分解与后训练目标对应起来,说明为何针对特定对齐目标的定向基准比通用基准更能判断方法是否达成其意图。 依据是 VBench 与 VBench2 的维度分解结果,以及 VideoPhy 与 VideoPhy2 把语义遵循与物理一致性分开评估的设计。
启示与展望
本文面向希望系统理解视频生成后训练与对齐的研究者与工程实践者,适用于需要在不从头重训的前提下适配预训练视频生成模型的场景,包括可控生成、个性化、领域特化、效率优化与安全生成。综述同时给出配套仓库用于持续收集论文与资源,可作为进入该领域的起点与开发新方法时的参考。文中汇总的基准结果适用于按对齐维度做诊断性比较,而非用于建立跨方法的统一排行榜。
作为综述,其结论建立在文献分类与已报告结果之上,作者本人也提示跨基准数字因任务设定、基座模型、模型规模、采样预算、分辨率、视频长度与优化目标不同而不可直接比较。读者仍需关注可扩展奖励设计、长时程时序一致性、稳定性与表现力权衡、以及安全感知生成等开放问题在后续工作中的进展;此外,本次读取的文本在参考文献列表处被截断,部分条目与表格细节未能完整呈现,若需逐条核对具体方法或数值,应以原文与配套仓库为准。
