跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

F-DSM 将等待概率与文本词表分布分解,在日语与英语流式识别上优于 DSM 并降低显存占用

该工作先证明在延迟流建模(DSM)中可以移除填充 token 而保持有竞争力的识别性能,进而提出因子化 DSM(F-DSM),把等待概率与原始 LLM 词表分布分离,从而将 ASR 专用 token 移出文本预测空间并在等待步跳过大规模词表 softmax;在 Corpus of Spontaneous Japanese 与 LibriSpeech 上的实验显示 F-DSM 识别性能优于 DSM,同时大幅降低 GPU 显存占用、保持相近训练吞吐、通过 softmax 跳过带来小幅推理加速,并减轻 DSM 中出现的纯文本困惑度退化。