跳到主要内容
返回时间线
arXiv来源发表:

Pruned CTC 把大词表 CTC 训练显存从线性增长中解放,LLM-CTC 在 GigaSpeech 上以 7–10 倍更快识别保持 7% 以内相对 WER

核心概要

该工作提出 Pruned CTC:利用每个合法 CTC 对齐只用到目标 token 与 blank 这一结构,把对齐计算限制在批内目标类与 blank 的子集上、同时保留全词表归一化,并证明其在损失与一阶梯度上与全词表 CTC 精确等价;在 Zipformer-M 与 180K 词表下把完整训练步显存降低 5.1 倍、步时开销仅 17%,在三个语料上匹配标准 CTC 精度;基于它构建的 LLM-CTC 让预训练因果 LLM 以非自回归方式做原生词表 ASR,在 GigaSpeech 上六个 Qwen3 规模(0.6B 至 32B)内相对 LLM-CE 的 WER 差距在 7% 以内而识别快 7 至 10 倍,流式扩展在测试集上相对匹配的离线模型 WER 差距在 3% 以内。

AI-generated editorial illustration: Pruned CTC for Memory-Efficient Large-Vocabulary ASR Training

深度剖析

Pruned CTC 把 CTC 的对齐计算限制在批内出现的目标类加 blank 上,同时保留全词表归一化,并证明该词表缩减在损失与一阶梯度上与全词表 CTC 精确等价。 此前 CTC 需要把 frame-by-vocabulary 激活完整物化在显存中,大词表下代价高昂;Pruned RNN-T 只缩减时间-标签区域而保持词表维度不变,Cut Cross-Entropy 依赖每帧已知目标类,而 CTC 缺少帧级目标、后验由前向-后向在整段转写上计算。该工作把缩减后的对齐计算与全词表归一化、稠密梯度重建分离,并用分块重计算避免物化整块激活。 论文给出 Proposition 1 的完整证明(附录 A),说明分组后每个保留对齐的概率不变、梯度经链式法则与全词表一致;附录 B.2 在 22 种词表(500 至 180,000 类)与 16,000/32,000/64,000 帧批大小上做了 1,188 组对比,报告损失、head 输入梯度与权重梯度的最大相对误差,并指出 FP32 累加是主要误差来源。

在 Zipformer-M 编码器与 180K 词表下,Pruned CTC 把完整训练步显存降低 5.1 倍,步时开销仅 17%,并在 LibriSpeech、GigaSpeech、AISHELL-1 三个语料上给出与标准 CTC 几乎一致的 WER/CER。 论文报告 head-and-loss 激活显存不再随词表大小线性增长:在 16k 帧批大小下从 43.0 GiB 降到 1.29 GiB(33.3 倍),且标准 CTC 在部分配置下直接显存不足,而 Pruned CTC 全部跑通。 表 4 给出三种批大小下 2.3 至 5.1 倍的完整步显存缩减与 14% 至 17% 的步时开销;表 1 在 LibriSpeech test-clean/test-other、GigaSpeech dev/test、AISHELL-1 dev/test 上逐项列出标准 CTC 与 Pruned CTC 的数值,两者差异在小数点后第二位量级。

基于 Pruned CTC 的 LLM-CTC 让预训练因果 LLM 以非自回归方式在原生词表上做 ASR,保留因果注意力,并在六个 Qwen3 规模上相对 LLM-CE 保持 7% 以内相对 WER,同时识别快 7 至 10 倍。 此前 LLM 语音识别多采用 token 级交叉熵加自回归生成(LLM-CE),流式还需依赖 chunk 级语音-文本对齐;LLM-CTC 用 utterance 级转写监督直接适配预训练 LLM,无需 chunk 级对齐。 表 3 在 GigaSpeech 上列出 0.6B 至 32B 六个规模的 LLM-CE 与 LLM-CTC 的 dev/test WER 与 RTF:LLM-CTC 测试 WER 从 0.6B 的 10.57% 降到 32B 的 9.94%,RTF 从 0.0724 降至 0.0099 等;4B 及以上 LLM-CTC 的测试 WER 低于 SPEAR-XLarge CTC 与 RNN-T 基线。

LLM-CTC 的流式扩展用 utterance 级监督配合有界历史推理与 KV cache 复用,在 GigaSpeech 测试集上相对匹配的离线模型 WER 差距在 3% 以内。 流式版本避免训练时的 chunk 级语音-文本对齐,并让每个 chunk 的 query 输出在一次 LLM 前向中产生;附录 E.1 证明并行批计算与逐句缓存计算在精确算术下等价。 表 4 对 Qwen3-ASR 0.6B 与 1.7B 分别给出离线与 2/4/8 秒左历史的流式 WER,测试集上流式相对离线增幅小于 3%;左历史从 2 秒增至 8 秒对 WER 影响很小。

启示与展望

该结果面向使用大词表 CTC 目标的语音识别训练:编码器侧在 Zipformer-M 与 500 至 180,000 类词表、16,000 至 64,000 帧批大小下验证;LLM 侧在 SPEAR-XLarge v2 编码器配 Qwen3 0.6B 至 32B、以及 Qwen3-ASR 0.6B/1.7B 的 LoRA 微调下验证,语音编码器与 LLM 词表头保持冻结。流式设置限定为 2 秒 chunk 与 1 至 8 秒左历史。论文声明代码与预训练模型将开源,这为后续在其它语种、其它编码器或其它 CTC 目标上的复用提供了入口。

论文报告 Pruned CTC 的 head-and-loss 激活显存不再随词表线性增长,但完整训练步的缩减受 head 与损失之外的存储和激活限制,8B 与 14B 的完整步缩减分别为 38.2% 与 27.3%,低于 head/loss 层面的 24.8 至 25.7 倍。有限 beam 对齐剪枝会引入损失不连续,论文用 alignment beam 100 并在附录 B.3 以丢弃后验质量不超过给定阈值的经验估计来支撑该取值,这些估计被明确说明为数值估计而非认证上界。附录 B.2 指出当两个梯度项在选中类上接近抵消时舍入误差可能主导其差值,并给出精度策略与误差量级。流式方面,左历史从 2 秒增至 8 秒对 WER 影响很小,论文将其描述为长历史收益有限。此外,本证据包为全文文本,未包含图表图像本身,因此图 4、图 5、图 7、图 8 的具体曲线形态只能依据正文描述理解。

来源