跳到主要内容
返回时间线
arXiv来源发表:

NTU团队发现说话人验证的EER无法追踪人类听感相似度,改用嵌入有效维度后对齐相关系数从0.08升至0.74

核心概要

该研究在VoxSim的16,905对不同说话人语音对上建立人类感知对齐指标,系统比较五种模型条件下七种训练目标,发现验证准确率(EER)与人类相似度判断不相关,而嵌入空间的有效维度与感知对齐呈约-0.95的秩相关,并在ECAPA-TDNN上通过维度瓶颈把AM-Softmax的对齐相关系数从0.08提升到0.74。

AI-generated editorial illustration: Rethinking Automated Voice Similarity by Shifting from EER to Embedding Geometry

深度剖析

感知对齐主要由训练目标决定,而非验证准确率:在每种模型条件下,最好与最差目标的人类感知对齐相差三倍以上,且不伴随EER代价;原型类度量损失最高(0.395–0.499),分类损失最低(0.080–0.298),AM-Softmax在所有条件下垫底。 此前社区默认EER最低的说话人验证模型就是最好的人类听感代理,该工作首次用统一的人类评分基准系统检验这一前提,并给出反例:在ECAPA上把AAM-Softmax换成Angular Prototypical,对齐相关系数从0.111升到0.406,而EER同为1.47%。 35个训练条件(五种模型条件×七种目标×三个随机种子),在VoxSim的16,905对不同说话人语音对上计算嵌入余弦相似度与听众平均评分的Spearman秩相关;EER在VoxCeleb1-O上以原始余弦相似度报告。

嵌入的有效维度(d_eff)是感知对齐的几何指示器:在五种模型条件内,d_eff与对齐的Spearman相关从-0.85到-0.99,合并35个条件后达到-0.95,四个条件通过置换检验拒绝零相关(ReDimNet-B2除外)。 以往工作记录了不同目标会重塑表示维度,但未把它与人类感知对齐直接联系起来;该研究把低维人类声音感知的既有发现与嵌入几何对接,并指出d_eff仅由说话人质心计算、无需人类评分。 d_eff用说话人质心PCA特征值谱的参与率(PR)度量,先做L2归一化并按说话人平均以抑制话语噪声;ECAPA-TDNN的21次运行紧密落在对角线上,七个条件均值相关达-0.99。

显式压缩嵌入维度可以提升感知对齐:在ECAPA-TDNN上把维度从192降到3,四种目标的对齐相关系数全部上升,AM-Softmax从0.080升到0.738,成为全研究中对齐最好的模型。 这把d_eff从观察性相关指标变成可操作的训练杠杆,说明对齐可以被几何手段直接操纵,而不只是被事后测量。 每个维度设置用四个目标各训练三个种子;维度从192扩到512时EER、d_eff与对齐几乎不变,说明名义维度只是上界;压缩到10和3时EER升至13–37%,AAM-Softmax在3维有两个种子不收敛。

EER与人类判断的脱钩在公开最强检查点上同样成立:ECAPA条件下四个公开检查点落在低EER但低对齐的区域,与“更好的验证器即更好的人类感知代理”的社区预期相矛盾。 这提示TTS与语音转换中普遍用说话人嵌入余弦相似度作为音色相似度自动指标的做法,需要重新审视其选择依据。 对比对象为公开检查点与作者自训模型在相同VoxSim语音对上的表现;跨35个条件EER与对齐的总体相关为-0.13,单一模型条件内符号不稳定(-0.14到0.43),无置换检验拒绝零相关。

启示与展望

该结果面向以说话人嵌入余弦相似度评估合成语音音色相似度的语音生成与转换流程,适用于英语VoxCeleb1说话人、VoxSim人类评分以及所考察的五种模型条件与七种训练目标;作者释放了代码、配置与随机种子,便于在相同设置下复现与扩展。d_eff只需说话人质心即可计算,因此可作为训练中或选型时的几何监测量,用于在无人类评分时筛查候选嵌入模型。

维度瓶颈在提升对齐的同时使EER升至13–37%,AAM-Softmax在3维时三个种子中有两个不收敛,因此对齐与说话人区分度之间的取舍如何在实际系统中设定仍是开放问题。d_eff与对齐的相关在ReDimNet-B2上未通过置换检验,说明该几何指示器在不同架构上的稳健性还需更多条件检验。此外,人类评分来自13位听众、每对约两次评分,评分噪声对相关系数上限的影响未在文中量化;VoxSim限于英语VoxCeleb1说话人,跨语种与跨数据集的泛化仍待观察。

来源