跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

微调大型音频语言模型并注入低层声学特征与说话人人口学信息,在构音障碍语音检测上超越深度学习基线,Qwen2-Audio-Instruct 达到当前最优

该工作提出一个框架,将语音录音与包含低层声学特征和说话人人口学信息的文本一起用于微调大型音频语言模型(LALMs)以检测构音障碍语音;在两个 LALM 上该框架均优于基于深度学习的基线,其中 Qwen2-Audio-Instruct 取得当前最优性能,消融实验显示微调时加入声学特征与说话人人口学信息可提升性能,而单独使用 LALM 的零样本表现仅为随机水平。