跳到主要内容
返回时间线
arXiv来源发表:

YuE2 用可读乐谱先作曲再渲染,专家在整体质量上以 49.3% 对 34.6% 偏好符号规划

核心概要

YuE2 用一个约 3.58B 参数的 AR–NAR Mixture-of-Transformers 先写出包含旋律、和弦、调性、拍号、速度与曲式的 ABC 乐谱,再展开为语义音乐 token 并渲染成整首歌的音频,配套的 MERT2 与 SheetSage2 从录音中构造语义与符号监督;同一检查点下专家以 49.3% 对 34.6% 偏好带符号规划的生成,在 WildSongBench 上 YuE2 的 SongBench Global Avg 为 6.7316、best-of-8 为 6.9632,MERT2 在 15 项 MARBLE 指标中的 14 项超过此前最好结果,SheetSage2-AR 在 15 个基准–指标对中的 12 个领先。

AI-generated editorial illustration: YuE2: Unifying Symbolic and Audio Music Generation at Frontier Quality

深度剖析

YuE2 把“作曲”变成生成过程中的显式中间产物:模型先输出可读的 ABC 乐谱(旋律、和弦、调性、拍号、速度、曲式),再生成 25 Hz 语义 token 与 25 Hz 声学潜变量,由单独训练的 48 kHz 立体声解码器还原整首歌。 此前的符号模型(如 Music Transformer、SymPAC)止步于符号序列,音频模型(如 MusicLM、MusicGen、YuE、SongBloom、LeVo 2)把作曲隐含在音频表示里;YuE2 在同一个公开可得的生成器内联合建模可读乐谱、语义 token 与声学潜变量。 论文给出完整架构与训练细节:28 层骨干、约 3.58B 参数、24,576 位置上下文、约 346,000 小时音乐训练数据,并列出四种训练任务以支持同一检查点的匹配消融。

符号规划本身提升被感知的歌曲质量:在检查点、提示、候选预算与解码器固定的条件下,专家对整体质量给出 49.3% 偏好规划、34.6% 偏好无规划,音乐性为 45.0% 对 29.4%,旋律为 44.0% 对 29.5%,和弦进行为 39.0% 对 21.0%。 以往工作多把符号条件当作外部输入(如 Music ControlNet、JASCO 跟随给定控制),或只规划速度、调性、时长与结构(如 ACE-Step 1.5);这里把“先写旋律与和弦乐谱”作为生成器自身的一步,并用同一检查点做匹配对照。 直接规划对照包含 212 份保留的专家评估,整体质量与音乐性各 211 份判定;旋律与和弦由同一专家池中 4 位听者评估 100 对歌曲、每项 200 份判定,采用按评估者与歌曲聚类的 CR1 标准误与双侧检验。

统一 MoT 优于分离的 LM+DiT:在两者都使用旋律–和弦符号规划、共享同一语义 tokenizer、声学 VAE 与训练数据量的条件下,专家对整体质量给出 53.4% 偏好 YuE2、35.6% 偏好分离 LM+DiT,音频质量为 48.5% 对 29.6%。 许多近期歌曲生成器采用“自回归语言模型 + 独立扩散 Transformer”的两段式设计;该实验把表示与规划方法固定,只比较统一与分离这一设计选择。 对照基线 LM 与 DiT 各 1.7B(合计 3.4B),与 3.58B 的 MoT 规模相当,LM 与 MoT 的 AR 部分使用相同 token 预算、批大小与更新步数;该对照包含 209 份保留专家评估,每项标准 206–208 份判定。

同一检查点把乐谱变成可编辑接口:对应录音的旋律与和弦序列相似度为 0.9464 与 0.9246,而错配录音仅 0.2160 与 0.2473;局部编辑达到 84.17% 目标音高准确率、79.54% 目标和弦一致率,同时保留 90.16%–94.34% 的未编辑旋律与和弦;在 948 首未见作品上零样本生成翻唱,八项作品身份检索指标全部超过两个被评估的翻唱系统。 以往翻唱系统需要专门的旋律条件模块或原曲–翻唱配对训练;YuE2 复用从单首录音学到的“乐谱到音频”映射,无需翻唱专用训练,并让外部语言模型代理把用户反馈转成乐谱修订。 乐谱–音频一致性实验覆盖 384 份生成乐谱与 768 段录音,含错配与无乐谱两个控制;编辑实验产生 3,844 段录音并保留全部输出;翻唱评估使用 SHS100K 官方测试划分的 948 首作品,作者用 CLEWS 与 Discogs-VINet 核验其不在训练语料中。

启示与展望

这项工作面向整首歌生成、乐谱级编辑与零样本翻唱三类任务,适用场景是文本与歌词条件、需要可检查作曲的创作流程。它使后续工作可以:把乐谱当作人与语言模型代理共同修改的接口;用 MERT2 的 375 bits/s 语义 token 流做下游自回归生成;用 SheetSage2-AR 从录音批量构造对齐的符号监督。受益者包括歌曲生成研究者、音乐信息检索研究者与需要可控作曲的创作工具开发者。翻唱结论适用于带人声、具备完整自动转写与两个风格替代版本的 SHS100K 作品;专家偏好结论适用于论文设定的听音协议与候选预算。

自动指标与专家偏好并不总是一致:YuE2 best-of-8 的 SongBench Avg 高于 Suno v6,但专家整体偏好仍以 59.3% 对 31.6% 偏向 Suno v6;SongEval 上 HeartMuLa 的 Musicality 与 Avg 更高,而论文说明 HeartMuLa 在训练后阶段使用了 SongEval 与 AudioBox。翻唱实验中,放松乐谱条件会提高风格对齐与质量分数,却降低作品身份检索,作者把这一权衡与和声在音乐风格中的作用联系起来,但这是定性解释。代理式音乐编辑目前是单个案例研究(《The Last Train》的九步、十四个渲染版本),不是受控评测。此外,本证据包为论文全文,但部分附录表格与图未随文本完整呈现,涉及具体数值的细节仍以原文为准。

来源