跳到主要内容
返回时间线
arXiv来源发表:

NVAlign 用冻结 NV-ASR 的可微奖励直穿流匹配采样器,把三个连续 AR-FM TTS 系统的人评标签跟随率最高从 39.8% 提到 54.0%

核心概要

NVAlign 提出一种面向连续自回归流匹配 TTS 的直梯度后训练框架:先在带非言语发声标注的语音上监督微调 TTS 模型与基于 Qwen3-Omni-30B 的 NV-ASR 模型,再冻结 NV-ASR 作为奖励模型,用两步梯度代理把目标标签概率的梯度穿过流匹配采样器,联合更新自回归骨干与声学流头,并以保真度惩罚和参考速度正则约束更新;在 NVV-SuperBench 与盲听评测中,其标签跟随准确率在 VoxCPM2、dots.tts 和一套英文生产系统上均高于 SFT 与 Flow-GRPO 基线。

AI-generated editorial illustration: NVAlign: Direct-Gradient Optimization for Non-Verbal Control in Continuous Autoregressive Flow Matching Text-to-Speech

深度剖析

论文提出 NVAlign,把冻结 NV-ASR 对目标标签 token 的概率作为可微奖励,直接反传到连续 AR-FM TTS 的生成过程,并联合更新自回归骨干与流头。 此前连续 AR-FM TTS 缺少既定的非言语控制后训练方法:离散 token 模型可用 GRPO 一类似然比方法,而连续采样没有 token 概率;已有 Flow-GRPO 通过随机微分方程适配似然比,NVAlign 则走直梯度路线。 方法层面给出完整公式化描述:两步梯度代理以两次 DiT 流头求值替代整条轨迹反传,并用直通式潜变量连接器把梯度引向骨干;实验在 VoxCPM2、dots.tts 与一套英文生产系统上以相同 SFT 检查点初始化对比 Flow-GRPO。

在独立盲听集合上,NVAlign 的标签跟随准确率相对 SFT 全面提升:VoxCPM2 从 43.2% 到 47.6%,dots.tts 从 63.2% 到 65.4%,英文生产系统从 39.8% 到 54.0%。 这是把直梯度奖励优化从图像扩散、语音可懂度或说话人目标,扩展到连续 AR-FM TTS 的非言语标签跟随,并给出跨三个系统的同向人评结果。 每语言 100 条文本的盲听集合,三名盲评者对标记位置的目标声音判定,需三人一致才算正确;对英文相对 SFT 的两项增益、VoxCPM2 相对 Flow-GRPO 的两项增益以及英文 100 文本相对 Flow-GRPO 的增益,配对 95% bootstrap 置信区间不含零,其余比较的区间含零。

消融显示 NV-ASR 奖励本身不足以刻画输出质量,保真度惩罚与参考速度正则是把更高奖励转化为可听声音的关键。 论文把奖励可被识别器“钻空子”的现象量化:去掉速度正则后奖励从 0.468 升到 0.488,而 Gemini 准确率/感知效果从 3.54/3.34 降到 2.88/1.94;再去掉 UTMOS 项,其预测质量分从 3.39 降到 3.01;去掉说话人项后 SIM 从 0.796 骤降到 0.360。 累积消融在统一设置下逐项移除约束并同时报告奖励、Gemini 评分、UTMOS 与 SIM;论文也说明 SIM 与 UTMOS 属于训练目标的一部分,因此额外报告 DNSMOS 与人工自然度 MOS,后者在三套系统上均与 SFT 相差不超过 0.1。

NVAlign 在提升标签跟随的同时基本守住语音质量与说话人相似度,但标签存在、表达质量与语音质量并不必然同向变化。 论文明确区分三类指标:相对 SFT,三套系统的 SIM、UTMOS、DNSMOS 均上升;普通话 CER 分别上升 1.26 与 0.13 个百分点,英文 WER 在听测集上升 0.07、在 NVV-SuperBench 上升 1.33;英文基准上人评标签跟随从 33.7% 升到 53.7% 而 Gemini 感知效果下降。 指标覆盖基准输出与每系统 100 条留出片段,CER 用 Paraformer-zh、WER 用 Whisper-large-v3 在去掉 NVV 标签的参考转写上计算;论文据此指出标签存在、表达质量与语音质量需要分开评估。

启示与展望

该框架面向连续自回归流匹配 TTS 的非言语标签跟随,适用于已有带 NVV 标注语音、且能训练出 NV-ASR 奖励模型的场景;论文在 VoxCPM2、dots.tts 与一套英文生产系统上验证,覆盖 39 标签清单与中英两种语言。对使用者而言,它给出的是后训练配方:先监督微调 TTS 与 NV-ASR,再冻结识别器、以两步梯度代理反传奖励,并同时施加保真度惩罚与参考速度正则。论文的表述假设非言语事件是离散的,连续或重叠发声不在当前范围内;奖励模型本身也受稀有发声样本稀缺的限制。

奖励由学习得到的 NV-ASR 给出,优化该奖励可能利用识别捷径或损害韵律,因为标签似然并不覆盖完整语音分布;保真度惩罚与参考速度正则能约束这种漂移,但目标增多后梯度平衡本身成为优化问题。人评增益的统计支持并不均匀:英文相对 SFT 的两项增益、VoxCPM2 相对 Flow-GRPO 的两项增益与英文 100 文本相对 Flow-GRPO 的增益置信区间不含零,其余比较含零,其中 dots.tts 在 NVV-SuperBench 人评子集上比 SFT 低 2.7 个百分点。此外,SIM 与 UTMOS 参与训练目标,其提升需与 DNSMOS 和人工自然度 MOS 一并解读。当前表述假设离散非言语事件,连续或重叠发声的效果仍待观察。

来源