跳到主要内容
返回时间线
arXiv来源发表:

F-DSM 将等待概率与文本词表分布分解,在日语与英语流式识别上优于 DSM 并降低显存占用

相关研究与后续进展

核心概要

该工作先证明在延迟流建模(DSM)中可以移除填充 token 而保持有竞争力的识别性能,进而提出因子化 DSM(F-DSM),把等待概率与原始 LLM 词表分布分离,从而将 ASR 专用 token 移出文本预测空间并在等待步跳过大规模词表 softmax;在 Corpus of Spontaneous Japanese 与 LibriSpeech 上的实验显示 F-DSM 识别性能优于 DSM,同时大幅降低 GPU 显存占用、保持相近训练吞吐、通过 softmax 跳过带来小幅推理加速,并减轻 DSM 中出现的纯文本困惑度退化。

Source-provided article image: Factorized Delayed Streams Modeling for LLM-based Streaming ASR
Figure 1 ·

Figure 1: DSM (left) jointly predicts waiting <p> , word-start <w> , and text tokens; F-DSM (right) separates waiting from text prediction over the original LLM vocabulary.

arXiv

深度剖析

作者首先验证了 DSM 中的填充 token 可以被移除,同时仍保持有竞争力的识别性能。 此前 DSM 依赖填充 token 与词起始 token 共同参与同一 softmax 预测,该结果说明填充 token 并非维持识别性能所必需。 该结论由摘要中报告的识别性能对比支持,具体数值未在加载文本中给出。

提出因子化 DSM(F-DSM),将等待概率与原始 LLM 词表上的分布分开建模。 与 DSM 把 ASR 专用 token 与普通文本 token 放在同一 softmax 中预测不同,F-DSM 把 ASR 专用 token 移出文本预测空间,并在等待步跳过大规模词表 softmax。 方法描述来自摘要,属于设计层面的贡献,其效果由后续实验支撑。

在 Corpus of Spontaneous Japanese 与 LibriSpeech 上,F-DSM 的识别性能优于 DSM。 该结果说明因子化不仅带来效率收益,也在识别质量上相对 DSM 有所提升。 证据来自两个数据集的实验对比,摘要未给出具体错误率或提升幅度。

F-DSM 大幅降低 GPU 显存占用、保持相近训练吞吐、通过 softmax 跳过带来小幅推理加速,并减轻 DSM 中纯文本困惑度的退化。 这些效率与语言建模保持方面的收益,是相对 DSM 新增的工程与建模特性。 摘要报告了显存、吞吐、推理速度与纯文本困惑度四类指标的方向性结论,未提供具体数值。

启示与展望

该工作面向 LLM 基座的流式自动语音识别场景,适用于需要在同一时间轴上对齐声学流与文本流的系统。其收益在 Corpus of Spontaneous Japanese 与 LibriSpeech 两个数据集上得到验证,因此可直接参考的对象是使用 DSM 类建模、关注显存与推理效率的流式 ASR 研究者与工程团队。方法层面,F-DSM 的因子化设计可被后续工作用于进一步分离 ASR 专用控制信号与文本预测空间。

加载文本为摘要级内容,未包含具体识别错误率、显存下降幅度、吞吐与推理速度的数值,也未说明模型规模、训练数据规模与消融设置。因此读者仍需关注:填充 token 移除在更大词表或更多语言上的表现、因子化对等待步比例较高场景的影响,以及纯文本困惑度改善的具体幅度。这些属于后续验证的开放问题。

来源