arXiv 2026年10月5日该工作训练了15个掩码扩散编解码器TTS模型(19-133M参数、3个随机种子),在2000小时语音上训练并在推理时扫描精修步数T∈[1,16],对174名留出说话人测量零样本合成的ASR词错误率与说话人验证;结果显示精修弥合了86.2%的可懂度区间但仅弥合46.4%的身份区间(1.86倍不对称),Best-of-K搜索在四个独立编码器上以64.6-79.0%胜率恢复身份,且可分离的B(d)B(T)模型拟合显著优于替代模型(ΔAICc=+69.3),62%的剩余身份缺口位于编解码器而非生成器。该工作训练了15个掩码扩散编解码器TTS模型(19-133M参数、3个随机种子),在2000小时语音上训练并在推理时扫描精修步数T∈[1,16],对174名留出说话人测量零样本合成的ASR词错误率与说话人验证;结果显示精修弥合了86.2%的可懂度区间但仅弥合46.4%的身份区间(1.86倍不对称),Best-of-K搜索在四个独立编码器上以64.6-79.0%胜率恢复身份,且可分离的B(d)B(T)模型拟合显著优于替代模型(ΔAICc=+69.3),62%的剩余身份缺口位于编解码器而非生成器。掩码扩散TTS中精修提升可懂度、搜索提升身份:深度与推理步数不可互换该工作训练了15个掩码扩散编解码器TTS模型(19-133M参数、3个随机种子),在2000小时语音上训练并在推理时扫描精修步数T∈[1,16],对174名留出说话人测量零样本合成的ASR词错误率与说话人验证;结果显示精修弥合了86.2%的可懂度区间但仅弥合46.4%的身份区间(1.86倍不对称),Best-of-K搜索在四个独立编码器上以64.6-79.0%胜率恢复身份,且可分离的B(d)B(T)模型拟合显著优于替代模型(ΔAICc=+69.3),62%的剩余身份缺口位于编解码器而非生成器。该工作训练了15个掩码扩散编解码器TTS模型(19-133M参数、3个随机种子),在2000小时语音上训练并在推理时扫描精修步数T∈[1,16],对174名留出说话人测量零样本合成的ASR词错误率与说话人验证;结果显示精修弥合了86.2%的可懂度区间但仅弥合46.4%的身份区间(1.86倍不对称),Best-of-K搜索在四个独立编码器上以64.6-79.0%胜率恢复身份,且可分离的B(d)B(T)模型拟合显著优于替代模型(ΔAICc=+69.3),62%的剩余身份缺口位于编解码器而非生成器。