Tacit-TTS 用掩码非自回归解码把零样本语音克隆提速逾10倍,并在八种跨语言参考与婴儿咿呀、合成乱语参考上保持可用
核心概要
Tacit-TTS 从 IndexTTS2 蒸馏而来,用掩码非自回归生成替换自回归文本到语义解码、引入免训练声学长度的估计并对流匹配渲染器做 ReFlow 蒸馏,在两个英语和两个普通话数据集上取得有竞争力的零样本克隆质量,对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,且无需参考语音转写即可支持跨语言与非词汇参考。
深度剖析
Tacit-TTS 把 IndexTTS2 的自回归文本到语义阶段换成掩码非自回归生成器,T2S 阶段加速 26.5 倍,并通过 ReFlow 蒸馏把流匹配渲染器的欧拉步数从约 25 步降到 4 至 8 步。 此前非自回归零样本 TTS(如 MaskGCT)通常在文本-音频对上训练,而该工作改为从自回归教师蒸馏,并保留教师的说话人与情感条件接口。 论文报告 T2S 延迟从 5274 ms 降到 199 ms,S2A 从 875 ms 降到 310 ms,生成总延迟从 6149 ms 降到 509 ms,即 12.1 倍加速;消融显示 12 步 T2S 与 8 步 S2Mel 为默认配置。
该工作用免训练的声学长度估计替代对参考转写或学习式时长预测器的依赖:以参考音频的语音速率因子乘以目标文本音节数得到目标语义长度,并对速率做截断。 既有非自回归系统多依赖参考转写或学习式时长模型,该估计器直接从参考波形与目标文本计算,无需转写也无需训练。 论文用生成时长与真实时长的皮尔逊相关衡量,报告其相关性与其它系统相当,并在跨语言与非词汇场景中验证其泛化。
在四个零样本测试集上,Tacit-TTS 在英语数据集上取得所评估非教师基线中最高的说话人相似度,内容准确率与最强基线相当,感知质量接近 IndexTTS2。 该模型训练数据远小于 IndexTTS2 使用的 55k 小时,却仍保留教师的大部分零样本克隆能力,作者将其部分归因于同时迁移离散语义目标与连续隐特征的损失设计。 LibriSpeech test-clean 上 SS 0.875、WER 5.54,SeedTTS test-en 上 SS 0.849、WER 2.34;SeedTTS test-zh 上 SS 0.829、CER 1.71,AISHELL-1 test 上 SS 0.804、CER 2.21;UTMOS 与 DNSMOS 在四个测试集上均接近教师。
无转写条件在跨语言与非词汇参考下保持有效:使用 FLEURS 八种语言的参考时,Tacit-TTS 英语目标 SS 0.789、WER 0.10,中文目标 SS 0.692、CER 1.90,八种语言错误率均低于 1;在婴儿咿呀参考上其说话人相似度高于 IndexTTS2。 依赖转写的基线在这些场景中因 ASR 转写不可靠而退化或失败,例如 MaskGCT 在部分语言上失败率达 33.3% 甚至 100%,而两个无转写系统对所有参考均能生成。 跨语言实验每种语言取三位不同说话人的 6–12 秒参考,各生成 10 条英语与 10 条中文目标句;非词汇实验使用 70 段婴儿咿呀录音中选出的 3 条参考与 10 条合成乱语参考。
启示与展望
该结果面向需要从短参考录音克隆音色、且参考转写不可得或不可靠的零样本 TTS 场景,包括跨语言参考与非词汇发声;蒸馏路线适用于已有强自回归教师、希望以更小模型和更少推理步数保留其能力的团队。论文指出其目标不是从头训练更强模型,而是在小得多的蒸馏预算下尽量保留教师性能,因此适用前提是存在可用的教师系统与公开研究数据集。
论文提到普通话结果较弱,可能部分反映说话人覆盖不均衡(英语与中文说话人数量差异);感知质量由 UTMOS 与 DNSMOS 等无参考预测器给出,作者提醒这些预测器可能偏好与其训练分布相近的语音,因此仅作辅助指标。加速比随语句长度变化,在约 30 秒附近达到峰值,超过一分钟后因非自回归阶段的全自注意力而收窄。跨语言与非词汇实验的参考数量有限(每种语言三条、婴儿咿呀三条、合成乱语十条),其结论的适用范围仍待更大规模验证。伦理声明提示无转写克隆会降低从任意录音克隆声音的门槛,建议部署时要求被克隆说话人同意并配合水印与合成语音检测。
