冻结CTC声学模型与语言模型配合测试时自适应模块,让ASR从无标注测试数据中学习新词,在LibriSpeech上把复现OOV字符错误率相对降低最多14.97%
核心概要
该工作提出让自动语音识别在测试时从无标注测试数据中学习新词的上下文表示与拼写:冻结的CTC声学模型提供拼写候选,冻结的语言模型提供上下文证据用于检测词表外(OOV)词,一个自适应模块通过最小化Kullback-Leibler散度(KLD)目标来学习词元表示并扩展词表;作者还论证CTC加权的语言模型对数似然比可解释为未知正确ASR与无监督学习所得ASR之间的KLD,并借助Pinsker界把KLD的平方根解释为真实拼写与估计拼写之间全变差距离的上界;实验显示对复现的OOV词,相对相应的重打分系统,LibriSpeech上OOV字符错误率相对降低最多14.97%,构音障碍Speech Accessib
Figure 1: Overview of proposed test-time adaptation framework. The CTC model generates N-best hypotheses for an input utterance. Word spans with strong CTC-LM preference disagreement are selected as potential OOV regions (one span here). Top-K CTC spellings are used to initialize a placeholder token with uniform spelling prior. For the first occurrence, the placeholder is added into the vocabulary and fine-tuned in context, while the utterance is buffered for potential final refinement. Otherwise, we retrieve the existing placeholder and re-transcribe the test utterance, possibly reducing errors. The retrieved placeholder is further updated using unsupervised model adaptation.
arXiv深度剖析
提出一种在测试时从无标注测试数据中学习新词拼写与上下文表示的ASR自适应方案,由冻结的CTC声学模型提供拼写、冻结的语言模型提供OOV检测所需的上下文证据,自适应模块以CTC生成候选上的分布学习词元表示并扩展词表。 与依赖预先给定词表或需标注数据的有监督适配不同,这里把新词学习放在测试时、以无标注测试数据为来源,并让词表随学习过程扩展。 摘要层面给出系统组成与学习目标(最小化KLD),并报告在LibriSpeech与构音障碍Speech Accessibility Project数据上的OOV字符错误率相对下降,但未在可见文本中给出模型规模、数据量或消融细节。
给出一个理论解释:CTC加权的语言模型对数似然比可被解释为未知正确ASR与无监督学习所得ASR之间的KLD,并借助Pinsker界把KLD的平方根解释为真实拼写与估计拼写之间全变差距离的上界。 把用于优化的KLD目标与拼写估计误差的界联系起来,使该无监督适配目标具有可解释的统计含义。 属于论文自述的推导性论证,可见文本只给出结论式陈述,未展示推导步骤或假设条件。
在复现的OOV词上取得相对OOV字符错误率下降:LibriSpeech最多14.97%,构音障碍Speech Accessibility Project数据6.67%,比较对象为相应的重打分系统。 把新词学习的效果量化到两个不同性质的语料上,其中一个涉及构音障碍语音,扩展了该方法的适用场景描述。 为摘要报告的相对指标,基线明确为对应的重打分系统;可见文本未提供绝对错误率、样本量或统计显著性信息。
启示与展望
该结果面向测试时可获得无标注语音、且新词在测试数据中复现的ASR场景,方法以冻结的CTC声学模型与冻结语言模型加自适应模块为实现形式,适用于采用CTC与重打分框架的识别系统;对构音障碍语音的评估提示其可延伸至非典型语音的适配需求。
可见文本为摘要与元数据,未提供绝对错误率、测试集规模、新词出现次数分布与统计显著性,也未展示KLD推导的假设条件;因此KLD与全变差距离的解释在何种条件下成立、以及方法对仅出现一次的新词是否同样有效,仍是需要阅读全文才能确认的开放问题。
