跳到主要内容
返回时间线
arXiv来源发表:

微调大型音频语言模型并注入低层声学特征与说话人人口学信息,在构音障碍语音检测上超越深度学习基线,Qwen2-Audio-Instruct 达到当前最优

相关研究与后续进展

核心概要

该工作提出一个框架,将语音录音与包含低层声学特征和说话人人口学信息的文本一起用于微调大型音频语言模型(LALMs)以检测构音障碍语音;在两个 LALM 上该框架均优于基于深度学习的基线,其中 Qwen2-Audio-Instruct 取得当前最优性能,消融实验显示微调时加入声学特征与说话人人口学信息可提升性能,而单独使用 LALM 的零样本表现仅为随机水平。

Source-provided article image: Augmenting Large Audio Language Models with Low-Level Acoustic Features for Dysarthric Speech Detection
Figure 1 ·

Figure 1: Schematic illustration of the proposed method: a) Conventional fine-tuning of the LALM using raw audio and textual inputs. b) Fine-tuning with the proposed approach, where besides the raw audio and textual inputs, low-level audio features are extracted and incorporated into the textual input together with the task description and metadata.

arXiv

深度剖析

该框架将大型音频语言模型(LALMs)微调用于构音障碍语音检测,输入为语音录音与文本信息的组合,文本信息包含低层声学特征和说话人人口学信息。 此前自动构音障碍语音检测方法主要依赖深度学习,而 LALMs 虽在多种任务上表现强劲,其在构音障碍语音检测中的应用尚未确立;该工作首次提出将 LALMs 适配到这一任务的具体框架。 摘要报告在两个 LALM 上该框架均优于基于深度学习的基线,其中 Qwen2-Audio-Instruct 达到当前最优性能,说明结论建立在跨模型比较之上。

消融实验表明,在微调过程中加入声学特征和说话人人口学信息能够提升 LALM 的性能。 该结果把性能提升归因于文本侧的低层声学特征与人口学信息,而非仅靠 LALM 本身,为输入设计提供了可检验的依据。 证据来自消融研究,属于对输入成分的受控比较,但摘要未给出具体数值或效应量。

单独使用 LALM 时零样本性能仅为随机水平,说明未经微调的 LALM 无法直接胜任构音障碍语音检测。 这一对照凸显了微调与特征注入的必要性,与“LALMs 在多任务上表现强劲”的既有印象形成对照。 证据为零样本条件下的性能观察,摘要以“chance-level”描述,未提供具体指标。

启示与展望

该结果面向构音障碍语音检测这一具体任务,适用于能够获得语音录音并提取低层声学特征与说话人人口学信息的场景;其预期用途是支持而非替代依赖言语语言病理学家的传统临床诊断。对希望把大型音频语言模型引入语音病理相关任务的读者,该工作给出了一个可复用的适配范式:以微调为主,并把低层声学特征与人口学信息作为文本侧输入一并注入。

摘要未给出数据集规模、录音条件、说话人分布、评价指标与具体性能数值,也未说明低层声学特征的具体构成与提取方式,因此无法判断性能提升的幅度及其在不同人群或录音环境下的稳定性。零样本“随机水平”的具体度量方式同样未在摘要中说明。此外,本文档为摘要级材料,缺少正文、图表与实验细节,上述问题需查阅原文才能确认。

来源