NVIDIA 用 SADA 与 FLEURS 微调 Nemotron 3.5 ASR,将沙特 Najdi 与 Hijazi 方言 WER 从 55.05% 降至 29.96%,英语同时小幅改善
核心概要
这篇 NVIDIA 教程以 Cache-Aware FastConformer-RNNT 多语种流式 ASR 模型为基础,在 SADA 2022 的 Najdi 与 Hijazi 沙特方言数据上做最小化筛选(保留 103,559/125,490 条、133.7 小时、82.5%)、按 90% 沙特语音加 7% 英语与 3% 阿拉伯语 FLEURS 的加权回放混合、时长分桶批处理,并在两块 GPU 上训练 12,000 步约 4.5 小时,使 Najdi+Hijazi 测试集 WER 从 55.05% 降到 29.96%、CER 从 31.63% 降到 12.18%,全 SADA WER 从 58.84% 降到 35.61%,同时 FLEURS 英语 WER 从 11.04% 降到 10.42%、阿拉伯
深度剖析
在沙特方言上做窄目标微调并配合最小化筛选,可大幅提升目标方言识别率而不牺牲被舍弃的方言与英语能力。 与先在 11 个方言上做全量微调、验证 WER 仅从 49.5% 降到 46.7% 并很快进入平台期的做法相比,改为只训练 Najdi 与 Hijazi 后,目标测试集 WER 从 55.05% 降到 29.96%,全 SADA WER 从 58.84% 降到 35.61%,FLEURS 英语与阿拉伯语也略有改善。 在独立测试集上以 NeMo 评测脚本测得 WER/CER,训练 12,000 步、约 4.5 小时、两块 GPU;筛选保留 103,559/125,490 条(133.7 小时,82.5%)。
按权重声明回放混合(90% 沙特语音、7% 英语、3% 阿拉伯语 FLEURS)比把回放文件拼接进大清单更可靠,可缓解灾难性遗忘。 文中指出滑动窗口打乱可能长时间不触及追加在大清单末尾的行,因此拼接式回放集在训练大部分时间里实际上不存在;改用 OmegaConf 的 input_cfg 显式声明权重后,英语能力得以保留并小幅提升。 FLEURS 英语 WER 从 11.04% 降到 10.42%、CER 从 6.47% 降到 4.53%,阿拉伯语 WER 从 12.67% 降到 11.41%,说明回放确实在专门化阿拉伯方言的同时守住了原有语言。
编码器解冻深度与可用数据量相关:在本实验的 134 小时目标语音下,解冻全部 24 层优于部分解冻。 文中给出 top 6(WER 33.42%)、top 8(WER 32.32%)、全部 24 层(WER 29.96%)的对照,并记录 top-8 配方中 230.4M 参数可训练、407.6M 冻结;部分冻结相对全量微调损失 2.4 个点。 同一数据与评测条件下只改变解冻层数的对照实验;作者明确说明这是关于该数据量的发现,而非通用规则。
推理端设置可在不重新训练的情况下换取精度,代价是延迟。 把注意力上下文从流式默认 [56,3] 换成最宽 [56,13] 降低 1.31 个绝对 WER 点,代价约 800 毫秒额外缓冲;MALSD beam-8 配合 [56,13] 相对贪心降低 2.71 个点,beam-4 在 0.59 倍贪心运行时间下把 WER 降到 28.81%。 同一检查点上的解码配置对照表;作者说明未评测 MAES 或 NGPU-LM 融合,结论限于 MALSD,并提示 strip_lang_tags=True 否则语言标签会被计为插入错误。
启示与展望
这套流程面向已有足够标注语音做专门化、但不足以从零训练模型的团队,适用于方言适配、领域特定转写以及必须保留既有语言的部署。文中给出的具体数值来自 SADA 2022 的 Najdi 与 Hijazi 以及 FLEURS 英语和阿拉伯语,模型为 Cache-Aware FastConformer-RNNT 多语种流式提示模型(strip_lang_tags、target_lang: ar-AR),训练在 12,000 步、约 4.5 小时、两块 NVIDIA RTX PRO 6000 Blackwell Workstation Edition GPU 上完成。作者把配置变更定位为排障示例而非推荐默认值,并说明权重衰减、梯度裁剪、混合精度与有效批大小等超参数沿用 NeMo 默认且未调优。文中还指出,回放只保护其数据所代表的能力,部分解冻在混合比例变化时需要重新调参,且该工作流不构成对所有阿拉伯方言或部署环境的证据。迁移到其他语言时,需要替换阿拉伯语归一化器、验证 Unicode 归一化与编码、测试基础分词器对姓名、数字、借词与混合脚本句子的覆盖,并在没有空格词边界的语言上改用字符、词元或词素级度量。
读者仍需留意:文中所有数值来自单一数据集组合与单一模型检查点,作者本人也强调这些配置是排障记录而非推荐默认值,因此换语料或换硬件后需要重新验证。回放比例(7% 英语、3% 阿拉伯语)与筛选阈值(UTMOS ≥ 1.25、SIGMOS 噪声 ≥ 1.5、SIGMOS 总体 ≥ 1.5)都是针对该语料分布设定的,文中提到默认 UTMOS 阈值 3.0 会几乎拒绝全部样本,说明阈值对语料高度敏感。解码结论限于 MALSD,未评测 MAES 或 NGPU-LM 融合。此外,本文是教程式文章,未报告多次运行的方差或统计显著性,因此 1 到 2 个点量级的差异(例如英语 WER 从 11.04% 到 10.42%)应视为该次实验的观测值。文中还提到 NVIDIA Nemotron 3 Diarization 可将流程扩展到最多 8 位说话人的说话人归属转写,但相关架构与基准细节指向外部博客,本文未展开。
