LAST 用循环复用同一组 Transformer 块只精炼类别 token,在 AudioSet 上以少 49.4% 参数超过十二层顺序模型 2.1%
相关研究与后续进展核心概要
LAST 先处理全部 token,再复用同一组块在固定音频特征上只精炼类别 token,使后续轮次开销很低;在 AudioSet 上十轮 LAST 达到 0.345 平均精度,相对十二层顺序 Transformer 提升 2.1%,同时参数少 49.4%、乘加运算少 42%、实测吞吐高 9.8%,并且从两轮到十轮增加精度而计算量仅增 1.2%,对时间掩蔽等听觉增强更稳健,在音乐、环境与事件声音分类上泛化更好。
Figure 1: LAST outperformed a deeper transformer at lower cost: AudioSet Computation per clip (x-axis) v/s AudioSet mAP (y-axis) Sequential AST uses D ∈ { 3 , 6 , 9 , 12 } D\in\{3,6,9,12\} layers; the recurrent models use D = 6 D=6 shared blocks and R ∈ { 2 , 4 , 6 , 8 , 10 } R\in\{2,4,6,8,10\} passes.
arXiv深度剖析
LAST 把额外处理集中在整合已算出的特征上:先处理全部 token,再复用同一组块只精炼类别 token,使后续轮次变得廉价。 相对于靠增加层数来提升识别的顺序 Transformer,LAST 把深度换成对类别 token 的重复精炼,而不是新增参数。 摘要给出机制描述与 AudioSet 上的对比结果,但未提供消融细节或统计检验。
在 AudioSet 上,十轮 LAST 达到 0.345 平均精度,超过十二层顺序 Transformer 2.1% 相对值。 这一精度优势同时伴随参数少 49.4%、乘加运算少 42%、实测吞吐高 9.8%。 摘要报告了单一数据集上的精度与效率数字,未给出多次运行或置信区间。
在分别训练的模型上,把轮数从两轮增加到十轮能提升精度,而计算量只增加 1.2%。 这说明收益来自重复精炼本身,而非与顺序模型共享的其他因素。 摘要以分别训练模型之间的比较支持该趋势,未报告逐轮曲线或方差。
进一步评估显示 LAST 对时间掩蔽和其他听觉增强更稳健,并在音乐、环境与事件声音分类上泛化更好。 稳健性与跨类别泛化是顺序深度之外被一并考察的维度。 摘要以定性表述概括这些评估,未给出具体增强类型、幅度或数值。
启示与展望
该工作面向音频识别,尤其是 AudioSet 上的声音事件与音频分类;其设计意图是在固定音频特征上以低成本重复精炼类别 token,因此适用于希望在不增加参数的前提下加深有效处理的场景,例如算力或吞吐受限的部署。摘要所述的稳健性与泛化结论针对时间掩蔽等听觉增强以及音乐、环境与事件声音分类任务。
摘要未说明循环块的具体结构、类别 token 精炼的实现方式、训练配置与评估协议,也未给出稳健性测试的具体增强类型与幅度。两轮到十轮的比较基于分别训练的模型,其逐轮趋势与方差未在摘要中呈现。由于本次仅依据摘要,图表与正文细节未纳入,上述数值与结论的适用范围仍需以原文为准。
