跳到主要内容
返回时间线
arXiv来源发表:

综述把视频-音频联合生成、跨模态生成与联合编辑统一到同一分布上,并首次系统梳理出九类、28种联合音视频编辑

核心概要

这篇综述指出视频与音频虽被共同感知、但多数生成模型仍各自独立处理,于是把联合生成、跨模态生成(由一方生成另一方)与联合编辑三类问题统一定义为同一个音视频对分布上的问题,围绕“输出如何在时间与语义上保持跨模态一致”这一核心问题,提出沿生成策略、音频表示、视频表示、对齐施加方式、预训练复用五个设计轴的分类体系,并首次系统梳理联合音视频编辑,将其映射为九类编辑、28种编辑类型,同时整理各设定下的方法、数据集与指标,最后给出长时程一致性、细粒度控制、物理合理性与评测等开放问题。

AI-generated editorial illustration: Joint and Cross-Modal Video-Audio Generation and Editing: A Unified Formulation and Design Taxonomy

深度剖析

论文提出一个统一形式化:把联合生成、跨模态生成与联合编辑视为定义在同一个音视频对分布上的三个问题,并用“音视频对应”(语义一致加时间对齐)这一对齐分数作为区分联合/跨模态设定与两个独立单模态问题的关键。 以往综述分别处理视频生成、音频生成或音视频理解,本文则把两条流作为耦合对来覆盖生成与编辑,并以跨模态一致性作为组织原则。 论文以定义形式给出音视频对应、潜在表示、时间同步容差与数据集定义,并用表格把三类问题逐任务实例化,属于概念与形式化层面的贡献。

论文提出五轴设计分类体系:生成策略(单塔、双塔、级联、统一 token、基于引导)、音频表示(连续潜变量、离散 token、梅尔频谱、波形)、视频表示(3D-VAE、2D-VAE 加时序模块、离散 token、像素)、对齐施加方式(交叉注意力、共享位置编码、判别器、分类器引导、显式先验)与预训练复用(从零训练、单一预训练、双预训练)。 该体系把方法差异归因到约束生成模型元组不同组件的少数几个轴上,并指出各轴互补而非正交,还标出未被占据的格子。 论文用一张覆盖数十个方法的表格逐方法标注各轴取值,并说明连续潜变量音频表示被表中二十九个方法中的二十八个采用、3D-VAE 被十九个方法采用、交叉注意力被十九个方法采用等分布情况。

论文称这是首个系统梳理联合音视频编辑的综述,把该空间映射为九类编辑、28种编辑类型,并给出代表性操作与用例。 此前没有把视频与音频作为耦合对来编辑的系统性分类,即一方指定的编辑必须传播到另一方。 论文以一张编辑类型表逐条列出类别、编辑类型、涉及模态、代表性编辑与示例用例,并在正文中按同步、联合内容、跨模态迁移、身份与表演、场景与环境、叙事、生成式、质量与修复、横切维度逐节讨论。

论文整理各设定下的方法、数据集与指标,并指出若干结构性空白:没有联合方法以离散 token 生成任一流、音频到视频生成只有孤立尝试、联合音视频编辑缺乏共享基准。 这些空白被作为分类体系暴露出的具体研究方向,而非对已有工作的否定。 论文以数据集表、基准表与指标表列出代表性资源,并说明每个编辑方法都在自行组装或改造的数据上评测,因此编辑结果目前难以相互比较。

启示与展望

该综述面向希望在同一框架下理解联合生成、跨模态生成与联合编辑的研究者与工程实践者,适用于需要判断某方法在表示、对齐与预训练复用上如何取舍的场景。其范围限定为至少一方是输出、另一方出现在流程中的方法,单模态生成与不含生成或编辑成分的音视频理解被排除在外;完全闭源的商业系统因不披露表示与同步机制而被排除在分类体系之外,仅在附录列出面向用户的能力。分类体系被定位为对已公开文献的地图,覆盖截至 2026 年中的文献。

论文自述其覆盖反映截至 2026 年中的文献,若干系统仅有预印本或技术报告,细节可能变化,分类体系中的空白区域也可能迅速被填补;五轴互补而非互斥,在论文表述含糊处归类需要判断,逐方法表格记录的是作者阅读,引用来源仍具权威性。此外,联合音视频编辑目前没有共享基准,各方法在自行组装或改造的数据上评测,编辑结果之间难以直接比较;长时程一致性的评测时长远短于应用所假设的分钟级内容。本次载入的文本为完整正文,但表格以文本形式呈现,个别单元格信息不完整,可能影响对个别方法轴取值的精确复述。

来源