跳到主要内容
返回时间线
Apple Machine Learning Research来源发表:

把语音编码器压到 2.8 倍后,蒸馏学生模型在六组师生配对中的五组里与教师模型的相对词错率差距不超过 1.9%

核心概要

这项工作研究如何用蒸馏压缩 Apple 设备上端侧听写系统所用的流式神经音频编码器(tokenizer),其监督目标既不是离散 token 也不是输出分布,而是模型实际消费的量化前隐表示;只训练学生编码器以平方误差回归教师的逐帧隐表示,并用一个仿射层吸收师生宽度差异,因为该目标位于量化器和语言模型桥接之前,同一套方案可覆盖两种 token 接口,并同时适用于单独预训练和与语言模型联合训练的 tokenizer;在 2.8 倍压缩下,蒸馏学生在六组师生配对中的五组里无需任何微调即保持在教师相对词错率 1.9% 以内,并比同等容量独立训练的 tokenizer 相对提升 3.9%。

AI-generated editorial illustration: Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

深度剖析

论文提出以量化前的隐表示为蒸馏监督目标,而非离散 token 或输出分布,因为这是两种 token 接口共享的最后一个表示。 相对于以离散 token 或输出分布为目标的常见蒸馏做法,这里选择的是模型实际消费的量化前隐表示,从而在量化器与语言模型桥接之前施加监督。 论文以方法描述形式给出该设计,并说明只训练学生编码器以平方误差回归教师逐帧隐表示,用一个仿射层吸收师生宽度差异。

由于监督目标位于量化器和语言模型桥接之前,同一套蒸馏方案可覆盖论文支持的两种 token 接口,并同时适用于单独预训练的 tokenizer 和与语言模型联合训练的 tokenizer。 这使一套配方无需针对不同接口或不同训练流程分别设计,扩大了方法的适用范围。 论文以设计论证的方式说明该目标先于量化器与语言模型桥接,因此一套配方即可覆盖两种接口与两种预训练情形。

在 2.8 倍压缩下,蒸馏学生在六组师生配对中的五组里无需任何微调即保持在教师相对词错率 1.9% 以内,并比同等容量独立训练的 tokenizer 相对提升 3.9%。 这给出了压缩后学生模型在词错率上的具体保持程度,以及与同等容量独立训练基线之间的相对差距。 论文报告了 2.8 倍压缩、六组师生配对中五组、1.9% 相对词错率、3.9% 相对提升等具体数字,但未在给定文本中说明评测数据集、样本量或统计检验。

该压缩针对的是端侧听写场景中常驻 tokenizer 与稀疏激活基础模型争夺同一 DRAM 的问题,参数数量直接影响功耗与延迟。 论文把压缩动机落在端侧内存竞争与功耗延迟上,而非单纯的模型规模指标。 论文说明基础模型在 Instruction-Following Pruning 下稀疏激活,任一时刻只有少量专家占用 DRAM,常驻 tokenizer 因此与模型竞争同一内存。

启示与展望

这项工作面向 Apple 设备上端侧系统级听写的流式神经音频编码器压缩,适用于需要在稀疏激活基础模型旁常驻 tokenizer 的端侧场景;论文支持的两种 token 接口以及单独预训练和与语言模型联合训练两种情形都在同一套配方覆盖范围内。对希望降低端侧内存占用、功耗与延迟的工程实践者,这一结果提供了在 2.8 倍压缩下保持词错率的参考。

给定文本为不完整摘录,未包含评测数据集、样本量、统计检验、六组师生配对中未达标的那一组的具体情况,也未说明 2.8 倍压缩的具体度量方式与功耗延迟的实测结果。读者若要判断该结果在自身场景中的适用性,仍需关注这些未在文本中呈现的信息。

来源