AutoSynth 用音频条件自回归模型直接生成可编辑的 Helm 合成器程序,在合成器反演与文本驱动生成两项任务上取得有竞争力的结果
核心概要
AutoSynth 将 MIDI 演奏事件、固定合成器参数与可变长度调制路由序列化为统一序列,用音频条件自回归模型学习其依赖关系,先在大规模自动构造的音频–程序对上做监督学习,再用混合奖励的组相对策略优化后训练,从而在给定参考音频时直接预测合成器程序、在给定文本时借助预训练音频生成模型转换出程序,并在合成器反演与文本驱动生成两项任务上取得有竞争力的结果。
Figure 1: Overview of AutoSynth.
arXiv深度剖析
提出一种统一的自回归程序表示,把 MIDI 演奏事件、固定合成器参数和可变长度调制路由组织进同一序列,由同一个解码器生成。 以往符号表示(如 MIDI、ABC)只表达音高与时值,无法决定音色与合成方式;该工作把演奏、音色配置与调制结构纳入同一可执行描述,并按 MIDI→固定参数→调制路由的顺序建模其依赖。 论文给出序列格式与顺序消融:当前顺序在域内验证损失上总体低于固定随机参数排列和“固定参数→MIDI→调制路由”两种替代顺序,说明自回归顺序影响训练表现。
提出无需成对文本–目标程序标注的两阶段训练流程:从少量原生预设自动构造大规模监督数据,再用基于渲染反馈的混合奖励 GRPO 后训练。 监督数据由 Helm 的 274 个工厂预设与一个初始化状态经扰动扩展为两百万条五秒立体声音频–程序对;后训练用八个奖励分量的加权和,且不需要可微合成器。 消融显示,相比仅用 SFT,混合奖励 GRPO 在 Gemini–Woosh、FSD50K 与域内 Helm 三个反演测试集上六项指标全部改善,包括未用于奖励的 LanguageBind;文本驱动生成在 Gemini 上文本 CLAP、LanguageBind、CE、CU、PQ 均改善。
用同一个反演模型同时支持音频驱动与文本驱动两条路径,输出可直接编辑的合成器程序。 文本路径先用冻结的 Stable Audio 3 Medium 生成波形,再交由同一编码器–解码器反演;文本不直接输入程序解码器,两条路径共享编码器、解码器与渲染器。 在 Gemini–Woosh 反演上 AutoSynth 的音频 CLAP 距离为 0.37,优于 Synth Permutations 的 0.54 与 DDSynth-RL 的 0.49;在 Gemini 文本生成上其文本 CLAP 为 0.550、PQ 为 7.433,高于另外两种反演级联,且 PQ 未被直接优化。
在主观听测中,AutoSynth 在两项任务、两个测试集上均获得领先的对齐度与内容质量评分。 十位熟悉合成器的声音创作从业者在匿名盲测中对反演与文本生成分别评分,方法名隐藏、候选顺序随机化。 共收集 1,800 个有效评分,每个方法、测试集与维度各 50 个评分;反演任务上 AutoSynth 在两个测试集的两项评分均领先,尽管 DDSynth-RL 的 RMS 相似度更高。
启示与展望
该工作面向音乐制作与声音设计中的短音素材,而非完整歌曲;训练数据为单音与和弦演奏,不含长旋律。结果适用于 Helm 合成器表达范围内的声音:在面向声音设计的 Gemini–Woosh 测试集上优势明显,而在覆盖环境录音与语音等更广真实声音的 FSD50K 上,CLAP 差距收窄,论文将其归因于部分声音超出合成器表达范围。方法可扩展到其他合成器,但需要重新定义程序格式、数据增强规则与后训练奖励设计。论文开源了训练与评测代码,便于独立复现与比较。
论文指出,完整合成器程序生成仍缺少统一基准,不同合成器的表达能力与控制结构差异使跨系统比较难以区分生成方法与底层声音引擎的贡献。奖励分量与权重把人类声音设计偏好转译为训练目标,但程序格式因合成器而异、可合法使用的训练数据稀缺,数据增强规则与奖励设计的重要性因此上升。声音设计是创造性活动,声学特征保真度与语义距离都无法完全刻画创作意图与审美偏好,而音色审美涉及难以言说且因人而异的细微感知差异,无上下文的判断较为困难。此外,文本驱动生成在 FSD50K 上未取得最佳 LanguageBind 表现,说明面向更广音效任务的合成器声音匹配仍有提升空间。
