跳到主要内容
返回时间线
arXiv来源发表:

SRSP用冻结TTS的语音似然奖励训练风格规划器,在五项声学指标上超越可访问目标音频的标注基线

核心概要

该工作先验证语音-文本对齐只能弱预测下游声学相似度,随后提出语音奖励风格规划(SRSP):以冻结TTS模型对目标语音token的教师强制似然为奖励,用GRPO训练文本风格规划器;在ISCSLP 2026 CoT-TTS语料英文子集上,SRSP在五项下游声学指标上优于Base LLM与可访问目标音频的标注基线,并在LLM评判中获得更高的上下文恰当性与参考一致性。

Source-provided article image: Beyond Speech Captions: Speech-Rewarded Style Planning for Conversational Text-to-Speech
Figure 1 ·

Figure 1: Mean within-utterance Spearman correlations across both development partitions.

arXiv

深度剖析

在候选级分析中,语音-文本对齐(T2S)与下游声学相似度(S2S、情感相似度、MCD-DTW)仅呈弱相关,且按T2S选出的指令相对随机选择只有小幅提升。 此前工作把语音描述当作伪标签或中间表示,隐含假设描述保真度可代表控制效果;该工作用同一话语内八个候选指令的Spearman相关与选择实验直接检验这一假设。 在5,500条开发集话语上每条采样八个候选指令并合成,使用ParaCLAP-C、ParaCLAP-S、CLSP三种编码器计算T2S,与S2S、emotion2vec情感相似度、MCD-DTW做话语内相关;表1显示按任一T2S准则选择均优于随机,但按任一后验声学指标选择在全部五项指标上优于三种T2S准则。

SRSP以冻结TTS模型对目标语音token的教师强制交叉熵损失构造奖励,用GRPO更新文本风格规划器,无需目标风格标注。 与用语音描述做监督不同,奖励直接来自下游合成器对同一目标语音的似然,使规划器针对合成行为而非描述一致性优化;奖励还包含对过短、泛化、重复指令的辅助惩罚。 规划器为Qwen3.5-9B加rank-16 LoRA,冻结的奖励与合成模型为Fun-CosyVoice3-0.5B,训练一个epoch,使用TRL 1.3.0与DAPO式损失归一化;组内奖励标准化后做带KL惩罚的裁剪目标优化。

在英文ISCSLP 2026 CoT-TTS子集上,SRSP在两项评测划分的全部五项下游声学指标上均取得最佳结果,包括可访问真实目标波形的标注基线。 未适配的Base LLM在S2S上低于Raw TTS、MCD-DTW高于Raw TTS,说明仅加风格指令不保证提升;语音奖励后训练逆转了这一退化。 四个开发/测试划分各含2,750条话语(约5小时),dev_in/test_in留出训练中出现的完整场景,dev_out/test_out留出整部电影;AF-Next在三种编码器下T2S最高,却在五项下游指标上均排最后,与候选级错配一致。

在Gemini 3.8 Flash的盲测A/B评判中,SRSP在上下文恰当性与参考一致性两种设置下均被偏好于四个基线。 上下文设置不提供目标录音,因此相对RL前Base LLM的胜率(54.19%/53.67%)表明提升不止来自对参考的拟合,也涉及上下文恰当性。 在两个测试划分的全部话语上做盲测A/B,报告双侧精确二项检验显著;与真实语音相比SRSP在合成系统中胜率最高(18.41%/19.06%),但真实语音仍被整体偏好。

启示与展望

该结果面向以自然语言指令控制对话TTS风格的研究与工程场景:规划器在推理时只接收对话历史与回复文本,输出一句英文风格指令,与回复文本和同说话人提示音频一起条件化TTS。方法适用于有目标语音可构造奖励的训练阶段,奖励来自冻结合成器的教师强制似然,因此最直接适用于与训练时同一TTS后端(此处为Fun-CosyVoice3-0.5B)的部署。候选级分析结论适用于同一话语内候选指令的排序场景,提示在候选池中按描述对齐挑选指令并不可靠。

表达性语音评价依赖Gemini 3.8 Flash作为自动评判,尚未经人类听测验证,因此上下文恰当性与参考一致性的胜率应视为该评判设置下的结果。奖励计算与合成共用CosyVoice3,向其他TTS后端迁移仍是开放问题。真实语音在上下文设置中仍被整体偏好,说明合成系统与目标之间仍有差距。此外,加载文本中公式与部分数值以占位形式呈现,具体超参数与损失细节无法从该文本完整核对。

来源