用假名域 ASR 奖励做日语 TTS 强化学习后训练,目标汉字读音错误相对降低约四成且收敛更快
相关研究与后续进展核心概要
该研究针对日语正字法与读音非一一对应导致正字法 CER 奖励失真的问题,改用假名转写 ASR 模型与参考读音在假名域计算 CER(Kana-CER),在匹配的 GRPO 条件下对 Sarashina2.2-TTS 进行强化学习后训练;在 Joyo Kanji Yomi Benchmark 上,Kana-CER 奖励使目标汉字读音错误相对降低约四成,正字法 CER 与说话人相似度、客观语音质量保持相当,并在约 4k 步而非 18k 步达到最佳验证性能;同时观察到无 KL 正则时 Kana-CER 优化会导致严重输出拉长,KL 正则可显著抑制。
Figure 1: Evaluation metrics during RL on the validation split with β = 0.04 \beta=0.04 . Curves show the mean across five generation seeds with ± 1 σ \pm 1\sigma shading. Rings indicate the checkpoints selected by the common validation criterion. The pre-RL model is shown at step 0.
arXiv深度剖析
在假名域而非正字法域计算 ASR 奖励,可更直接地优化日语上下文相关的汉字读音。 此前 TTS 强化学习后训练普遍以正字法 CER/WER 作为可懂度奖励,而该工作首次将假名域 ASR 奖励用于日语 TTS 的读音导向 RL 后训练,把 Kana-CER 从评测指标转为训练奖励。 在 Joyo Kanji Yomi Benchmark 上,Kana-Whisper 评测下 Kana-CER(kanji)由正字法 CER 奖励的 9.65 降至 7.17,相对降低约四成;独立 wav2vec2-hiragana 评测器显示同样趋势,说明增益不局限于奖励管线所用的 Kana-Whisper。
读音增益不以牺牲正字法准确率或语音自然度为代价。 两种奖励条件在正字法 CER 上相当(4.10 与 4.15),且在 CV3-Eval 日语子集上说话人相似度与客观质量指标接近,说明奖励表示的差异并未带来其他维度的退化。 正字法 CER 由同一 Whisper large-v3-turbo 计算;SIM-o、UTMOS-s、UTMOS-v2、P.808、OVRL 五项指标在 pre-RL 与两个 GRPO 检查点之间相近,结果在五个生成种子上平均。
假名域奖励带来更高效的读音导向优化。 在共同验证准则下,Kana-CER 奖励在约 4k 步达到最佳验证性能,而正字法 CER 奖励需约 18k 步,且 Kana-CER 更早改善目标汉字读音并在此后检查点保持更低错误。 检查点每 1k 步评测一次,按验证集正字法 CER 与句级 Kana-CER 的均值选择;此外 RL 仅使用约一半的合成读音数据,Kana-CER 模型在表 1 各项指标上仍优于 Stage 2 SFT。
无正则的 Kana-CER 优化会诱发严重输出拉长,KL 正则可显著抑制。 该工作显式报告了假名域奖励下的长度退化现象,并给出 KL 正则作为缓解手段,使所选检查点在 Joyo Kanji Yomi Benchmark 上的输出时长接近 pre-RL 模型。 在无 KL 正则设置下,Kana-CER 使平均补全长度在最初数千步内翻倍以上,而正字法 CER 奖励仅引起中等变化;在主实验的正则设置下该拉长被显著抑制,Dur./base 为 0.985。
启示与展望
该结果面向需要正确实现上下文相关汉字读音的日语 TTS 后训练场景,适用于具备参考假名读音标注、且能提供假名转写 ASR 模型的训练管线;对希望以更少优化步数获得读音改善、同时保持正字法准确率与语音质量的团队,Kana-CER 奖励提供了可直接替换正字法 CER 的选项,并需配合 KL 正则以控制输出时长。
原文中多处数值在正文与表格中缺失或被占位符替代,例如相对降低幅度的具体百分比、RL 数据覆盖的汉字—读音对与汉字数量、每对句子上限、学习率、温度、top-p、最大补全长度、每输入补全数、奖励变换参数与 KL 系数,以及 Kana-Whisper 在 JSUT 上的 Kana-CER 数值;因此可复核的定量细节需回到原表与图。此外,长度退化仅在无 KL 正则设置下报告,不同正则强度下的权衡、以及在其他模型规模与 TTS 架构上的表现,仍是待观察的开放问题。
