跳到主要内容
返回时间线
arXiv来源发表:

Unite-Audio 把音频表征学习与潜在流匹配联合训练,用紧凑模型取得有竞争力的文本到音频生成效果

核心概要

该工作提出 Unite-Audio,将连续音频表征学习与潜在流匹配联合训练用于文本到音频生成,通过把重建与自监督生成预测耦合,让生成目标直接塑造潜在空间,并采用 Flow-GRPO 后训练改善文本条件生成;实验显示紧凑的潜在流模型取得有竞争力的文本到音频性能,消融研究确认联合学习音频表征与生成模型带来收益。

Source-provided article image: UNITE-AUDIO: Joint Learning of Continuous Tokenization and Latent Flow Matching for Text-to-Audio Generation
Figure 1 ·

Figure 1: Comparison between conventional separate tokenizer–generator training and our joint single-stage training.

arXiv

深度剖析

提出 Unite-Audio,据作者所述是首个将连续音频表征学习与潜在流匹配联合学习用于文本到音频生成的方法。 此前的文本到音频系统多采用两阶段潜在范式:先以重建为目标训练音频分词器并冻结,再在固定潜在空间中训练生成模型;该工作把表征学习与生成学习放在同一框架内进行。 依据为摘要中对该方法定位与两阶段范式对比的陈述,属于方法层面的主张,未在给定文本中给出具体架构细节或对比数值。

通过将重建与自监督生成预测耦合,生成目标可以直接塑造潜在空间,而不是把潜在表示当作固定的中间表示。 这改变了潜在空间仅由重建质量决定的惯例,使表征朝着有利于生成的方向优化。 摘要以机制描述的方式给出这一设计,并指出重建导向的表征可能对生成并非最优,作为该设计的动机。

采用 Flow-GRPO 后训练来改善文本条件生成。 在联合训练之外引入后训练阶段,针对文本条件生成质量做进一步优化。 摘要明确列出该后训练步骤,但未在给定文本中说明其具体配置或单独效果数值。

实验显示紧凑的潜在流模型取得有竞争力的文本到音频性能,消融研究确认联合学习音频表征与生成模型的收益。 以紧凑模型规模达到有竞争力的结果,并通过消融把性能收益归因于联合学习这一设计选择。 摘要给出实验与消融的结论性陈述,并提供了音频样例链接;给定文本未包含具体指标、数据集或数值。

启示与展望

该工作面向文本到音频生成这一任务,适用于希望以紧凑潜在流模型获得有竞争力生成质量的研究与系统设计场景;其核心主张适用于采用潜在生成范式的文本到音频系统,并提示后续工作可以把表征学习与生成目标联合优化,而不是先冻结分词器。摘要同时提供了音频样例链接,便于读者直接试听生成效果。

给定文本为摘要,未包含具体评价指标、数据集、模型规模与消融数值,因此无法判断“有竞争力的性能”相对何种基线、在何种条件下成立;Flow-GRPO 后训练的独立贡献、联合学习在不同音频类型上的稳定性,以及音频样例所展示效果的代表性,都是读者在阅读全文时仍需留意的开放问题。

来源