跳到主要内容
返回时间线
arXiv来源发表:

AdaLoop 用自适应深度循环模块让音频语言模型按问题难度分配推理步数,三个骨干平均准确率提升 2.9 至 3.8 分

核心概要

AdaLoop 用一个轻量循环模块替换音频编码器与语言模型之间的线性投影,由问题引导的共享 transformer 块反复精炼音频表示,并用可学习停机机制决定每个音频—问题对需要多少步;在 Qwen2.5-Omni-7B、Kimi-Audio-7B-Instruct 和 MiMo-Audio-7B-Instruct 三个骨干上,于 MMSU、MMAU-Pro、MMAR 三个基准把平均准确率提升 2.9 至 3.8 分,增益集中在感知类子任务,且学到的深度分布显示信号级问题平均用 5.7 步、语义问题仅 2.6 步。

Source-provided article image: AdaLoop: Adaptive-Depth Latent Reasoning for Audio Language Models
Fig. 1 ·

Fig. 1. Overview of AdaLoop. The Recurrent Latent Block (dashed) applies question-guided cross-attention, scale-aware self-attention with four window sizes (w), and a feed-forward update. Shared parameters iterate K times; a halting unit conditioned on both the pooled audio state and the question decides when to stop.

arXiv · 第 2 页

深度剖析

AdaLoop 把音频编码器到语言模型之间的线性投影换成自适应深度的循环模块:共享参数的 Recurrent Latent Block 在问题引导的交叉注意力与尺度感知自注意力下反复精炼音频表示,停机单元在每轮后输出一个同时以当前状态和问题为条件的标量停机概率,累计停机信号达到阈值即退出,输出为各轮表示的加权混合。 此前面向音频的迭代精炼方法(如 RecurTrace、AURAL、Thinking-in-Depth、CoRELoop)各自针对单一任务并使用固定迭代次数,而通用音频语言模型对每个查询都按同一固定深度前向计算;AdaLoop 让深度同时以音频和问题为条件,同一模型对语言识别用一两次、对精细音高比较用六次以上。 方法层面给出了完整的公式化描述(问题引导交叉注意力、按组划分窗口且感受野逐组翻倍的尺度感知自注意力、停机概率与加权混合输出),并说明模块可端到端训练;训练损失在标准下一词预测之外加入 ponder cost 以鼓励更少迭代。

在三个架构不同的音频语言模型上,AdaLoop 在 MMSU、MMAU-Pro、MMAR 上取得最高平均分与每个基准的最高分:相对 Base 平均提升 3.8 分(Qwen2.5-Omni)、3.4 分(Kimi-Audio)、2.9 分(MiMo-Audio);Qwen2.5-Omni 上十二个子类别全部提升,最大单项增幅为 MMSU 感知 +8.6 分。 消融把增益来源拆开:同一 5 万条训练数据只微调原连接器(SFT)得 1.2 分,换成固定四步的循环架构(Fixed-4)再得 0.9 分,加入自适应深度再得 1.7 分,说明最大一步来自自适应机制而非训练数据或循环结构本身。 三个骨干、三个基准的表格结果一致排序;消融表显示去掉自适应停机改用固定四步损失最大,去掉停机输入中的问题损失 1.6 分,去掉尺度感知注意力损失 1.2 分,去掉 ponder cost 或把上限压到四步各损失 0.8 分。

学到的推理深度与任务性质对应:在 Qwen2.5-Omni 上,信号级问题(音高比较、响度排序、语速估计)平均 5.7 次迭代,接近语义问题 2.6 次的三倍;感知类任务 4.3 次,文化推理 3.1 次;全部基准平均 3.8 次,从单次通过(9.3% 的条目)到上限八次(4.2%)。 深度分配完全由 ponder cost 驱动、没有任何显式深度标签,模型自行发现信号级判断需要跨尺度重复注意力、语义问题用一次高层嵌入即可解决;不同骨干的分布也随其感知强弱变化,Kimi-Audio 平均 4.2 次,MiMo-Audio 平均 3.9 次并在信号级任务上达到 5.4 次。 深度分布按 MMAR 类别分解并跨骨干报告;消融显示八次迭代提供了模型实际使用的余量,少数达到八次的问题包含最难的信号级比较。

模块轻量且与架构无关:RLB 匹配原连接器的隐藏维度,8 个注意力头分为 4 个尺度组,一层扩展比 4 的前馈层,参数增量仅占基座模型的 2.4% 至 2.9%,插入任意音频编码器与语言骨干之间而不修改二者,音频编码器全程冻结。 相比需要改动编码器或语言骨干、或针对单一任务设计的方法,AdaLoop 以不到 3% 的参数增量提供可迁移的推理深度控制,作者指出 Audio Flamingo 与 MiniCPM-o 等近期模型也可能受益。 训练在 4 张 NVIDIA A100-80G 上进行,每卡批大小 2、梯度累积 4 步(有效批 32);两阶段训练先冻结编码器与语言模型训练 RLB 与停机单元,再联合微调 RLB、停机单元与语言模型;音频输入统一截断到 3000 token(约 30 秒)。

启示与展望

该结果面向需要在推理时对音频做细粒度声学判断的通用音频语言模型:把 AdaLoop 插到音频编码器与语言骨干之间即可使用,无需改动两端,参数增量不到 3%,音频输入按 3000 token(约 30 秒)截断。它适用于语音韵律、说话人与对话、语音内容、声音事件、音乐与多片段场景等可验证问答族,训练数据为 5 万条来自 EvoAudio 可验证问答族的音频—问题对,源音频取自 LibriSpeech、FSD50K、AudioSet、AudioCaps、MELD,并由 Qwen3-TTS、LeVo 与 Scaper 合成或程序化混合。作者指出下一步是把自适应深度与更丰富的训练课程以及参数高效适配结合。

读者仍会关心:深度分布与消融数字来自 Qwen2.5-Omni 等具体骨干,换到其他编码器—语言模型组合时深度分配是否同样稳定;训练数据全部来自可验证的合成或带标签问答族,在真实开放域音频上的深度行为尚未在文中展示;音频统一截断到约 30 秒,更长录音下的迭代次数与收益如何变化仍是开放问题;MiMo-Audio 只报告 Base 与 AdaLoop,缺少 SFT 与 Fixed-4 的中间对照,其增益中数据与架构的相对贡献不如另外两个骨干清晰。

来源