将mDPO偏好学习扩展到音频域:Qwen2-Audio在DCASE 2025与AH Existence上分别提升14.0与27.4个百分点
核心概要
该工作把面向视觉语言模型的多模态直接偏好优化(mDPO)迁移到音频域,用反转、随机噪声、时频掩蔽等声学扰动构造“完好音频对扰动音频”的偏好对,在Qwen2-Audio-7B-Instruct上训练,使DCASE 2025音频问答整体准确率由56.0%升至70.0%,AH Existence由55.6%升至83.0%。
Figure 1: Overview of the mDPO framework for audio hallucination reduction.
arXiv深度剖析
提出音频域mDPO目标,把对比解码中的负向音频分支转化为偏好学习中的被拒输入,从而在权重层面而非推理阶段修正声学接地。 原mDPO依赖图像裁剪等视觉扰动,无法直接用于音频;该工作改用反转、随机高斯噪声、时间掩蔽、频率掩蔽与无音频等声学扰动,并保留标准DPO项、条件偏好项与锚定项三项损失。 在Qwen2-Audio-7B-Instruct上以分类准确率为指标,对三项损失做消融:完整目标把准确率从56.0%提升到71.4%,去掉锚定项后降至64.0%。
识别出时间反转、频率掩蔽与随机噪声是抑制音频幻觉最有效的扰动,并将三者组合成Triple Mixed训练集。 此前对比解码工作多把扰动用于推理期,该工作系统比较多种扰动在偏好训练中的效果,并给出可复用的扰动选择。 DCASE 2025测试集上反转67.1%、随机噪声67.4%、频率掩蔽67.3%,均高于无音频66.7%与时间掩蔽66.6%;Triple Mixed取得最高整体准确率70.0%。
在DCASE 2025上,扰动式偏好训练在未使用外部数据的情况下取得与使用外部数据微调的参赛队伍可比的Complex子集表现。 参赛系统多依赖人工数据整理、标注重排与迭代伪标注等数据扩充,该工作以扰动构造偏好对作为替代路径。 Complex子集上本方法为80.0%,DCASE Team 1为83.3%、Team 2为80.1%;Temporal子集上本方法43.8%,低于两队的60.4%与62.6%。
在AH Existence上,反转扰动取得83.0%准确率,优于推理期对比解码的76.7%。 把在DCASE上选出的最优超参数直接迁移到AH Existence而不重新调参,说明扰动偏好训练具有跨数据集可迁移性。 AH Existence测试集上基线55.6%,无音频81.3%、反转83.0%、随机噪声81.2%、频率掩蔽79.2%,对比解码76.7%。
启示与展望
该结果面向以Qwen2-Audio-7B-Instruct为骨干、以分类准确率为指标的选择题与二分类音频问答场景:DCASE 2025的Temporal与Complex子集,以及AH Existence子集。方法需要为每种扰动重新生成一份偏好训练集,因此扰动选择与超参数配置是使用该方法的前置条件。作者指出后续将把方法扩展到音频描述等开放式生成任务,并探索在训练中动态调整失真难度的自适应扰动策略。
DCASE 2025的Bioacoustics子集因音频数据未公开而未纳入评估,因此结论不覆盖该域。Temporal子集上本方法43.8%低于两支参赛队伍的60.4%与62.6%,说明扰动偏好训练对时序推理的提升幅度有限。AH基准仅使用Existence子集,Order与Attribute子集未评估。此外,原文中部分公式、锚定边距数值与扰动参数的具体取值在正文中以符号或表格形式呈现,若需复现应核对图1与各表格的完整数值。
