跳到主要内容
返回时间线
arXiv来源发表:

逐帧早退在端侧语音增强中是否划算:动态深度与静态模型在STM32N6上落在同一延迟-质量前沿,策略每帧仅26微秒

核心概要

该工作对一个因果语音增强模型的每个中间深度都施加监督,并微调各输出头以保证更深输出不劣于更浅输出,由此得到一族比同预算从零训练的等规模模型更帕累托高效的静态模型(同等算力下PESQ最高提升0.11,以少30%算力匹配最佳PESQ),并在STM32N6微控制器上量化到int8后测得动态增强器与静态模型落在同一延迟-质量前沿,配套Cortex-M55上策略每帧仅26微秒、拆分NPU图带来2.2%延迟开销。

Source-provided article image: Does per-frame early exit pay? A compute-matched study of dynamic depth for on-device speech enhancement
Figure 3 ·

Figure 3: Pareto front for Float32 deployments on the test set.

arXiv

深度剖析

提出一种训练协议:对单一因果模型的每个中间深度都进行监督,并微调输出头,使更深层的输出不会比更浅层更差。 以往深度可变网络通常需要单独训练或从零训练多个模型,而这里从一个模型派生出整族静态模型,并带有深度单调性的保证。 摘要说明该协议用于派生静态模型族,并在同等训练预算下与从零训练的等规模模型比较;具体训练细节、数据集划分与消融未在加载文本中给出。

由该协议派生的静态模型比同预算从零训练的等规模模型更帕累托高效:同等算力下PESQ最高高0.11,并以少30%算力匹配最佳PESQ。 把训练协议的价值量化为算力-质量前沿上的位置改善,而不只是单一质量指标。 摘要给出PESQ提升0.11与30%算力节省两个具体数字,比较对象是同等训练预算下从零训练的等规模模型;未报告置信区间或多次运行方差。

在STM32N6微控制器上量化到int8并测量延迟-质量前沿,动态增强器与静态模型落在同一前沿上,而非以质量换取动态执行。 把动态深度的讨论从理论或仿真推进到真实微控制器的int8部署测量,回应了多数设备只能加速静态int8图这一约束。 在VoiceBank-DEMAND上测量,硬件为STM32N6;摘要未给出具体延迟数值或前沿上的工作点数量。

动态执行的开销很小:策略在配套Cortex-M55上每帧仅26微秒,把增强器拆分为多个NPU图仅增加2.2%延迟。 直接量化了“用策略编排多个静态图”这一实现路径的调度与拆分成本,说明动态深度的额外代价可忽略。 摘要给出26微秒/帧与2.2%两个具体测量值;未说明测量条件、帧长或是否包含最坏情况。

启示与展望

该结果面向在只能加速静态int8图的设备上部署语音增强的工程场景,例如助听器、耳机与耳塞;它说明可以用一个因果模型派生出一族静态模型,再由策略逐帧选择深度,并在STM32N6上以int8测量延迟-质量前沿。对打算在类似微控制器上做动态深度推理的读者,这项工作提供了可复用的训练协议与调度开销量级(策略26微秒/帧、图拆分2.2%延迟),可作为方案选型与预算估算的起点。

加载文本为摘要级,未给出训练细节、数据集划分、消融实验、延迟数值与统计方差,因此无法判断PESQ提升0.11与30%算力节省在不同模型规模或不同策略下的稳定性。深度单调性保证是在微调输出头后成立,其在int8量化后是否仍然保持,加载文本未说明。26微秒/帧与2.2%开销的测量条件(帧长、是否含最坏情况、策略复杂度)也未给出,读者在据此估算自身系统预算时需保留余量。此外,结论基于VoiceBank-DEMAND这一数据集,其他噪声条件与语言下的表现仍是开放问题。

来源