跳到主要内容
返回时间线

基于CAPS-A-AM评估语音样本的人工智能高鼻音诊断:儿童腭咽功能障碍中的初步可行性研究

核心概要

这项前瞻性单中心研究收集了40名2至17岁儿童(包括腭咽功能障碍患者、相关疾病患者及健康儿童)在言语语言病理学家指导下采集的语音样本,以CAPS-A-AM共识评分为参照,将高元音/i/和/u/的梅尔频谱图输入逻辑回归、EfficientNet-V2-S注意力多实例学习CNN以及CNN-XGBoost混合模型,在“无高鼻音(0)对比任何高鼻音(1-4)”和“无/边缘(0-1)对比轻至重度高鼻音(2-4)”两个阈值下进行二分类,结果显示多种独立建模方法均能识别临床评定的高鼻音,其中EfficientNet-V2-S在本队列中取得最高观测性能(F1=0.786-0.900),但置信区间重叠,尚无法证

AI-generated editorial illustration: Artificial Intelligence-Based Hypernasality Diagnosis Using CAPS-A-AM Rated Speech Samples in Pediatric Velopharyngeal Dysfunction.

深度剖析

研究建立了一套以CAPS-A-AM标准化听觉感知评估为参照、基于梅尔频谱图的高鼻音AI检测工作流程与初步算法。 既往高鼻音评估依赖言语语言病理学家的听觉感知判断,本研究将标准化评估框架CAPS-A-AM与机器学习流程结合,探索在专家资源有限时提供可及性语音评估工具的路径。 前瞻性单中心设计,语音样本在言语语言病理学家指导下采集并建立共识评分,为模型开发提供了标准化参照;样本量为40名儿童。

多种独立建模方法(逻辑回归、EfficientNet-V2-S注意力多实例学习CNN、CNN-XGBoost混合模型)均能检测出临床评定的高鼻音。 研究同时评估了三种不同复杂度的机器学习方法,而非单一模型,说明高鼻音检测不依赖于某一种特定建模策略。 三种方法在同一队列、同一评估框架下比较,结果一致指向可检测性;但置信区间重叠,未能证明模型间优劣。

EfficientNet-V2-S在本队列中取得最高观测性能估计,F1分数为0.786至0.900。 该结果为基于梅尔频谱图的高鼻音分类提供了具体的性能参考区间,覆盖两个CAPS-A-AM阈值下的二分类任务。 性能估计来自40名儿童的单中心队列,置信区间重叠,因此该数值应视为初步观测而非确立的优越性证据。

研究在两个CAPS-A-AM阈值下测试模型:无高鼻音(0)对比任何高鼻音(1-4),以及无/边缘(0-1)对比轻至重度高鼻音(2-4)。 通过设置两个临床相关阈值,研究同时考察了模型对“是否存在高鼻音”和“是否达到轻至重度”的区分能力,贴近临床分诊需求。 阈值设定直接对应CAPS-A-AM评分体系,评估标准明确;但样本量有限,阈值间的性能差异需更大样本验证。

启示与展望

该研究界定了基于梅尔频谱图的高鼻音AI分类在儿童腭咽功能障碍队列中的初步可行性,适用于在言语语言病理学家指导下采集、并以CAPS-A-AM共识评分为参照的语音样本场景。其下一步意义在于扩大样本采集、纳入更多样化的语音输入用于训练与评分,从而为专家资源有限环境中的辅助评估工具奠定基础。

读者仍需关注:置信区间重叠意味着模型间优劣尚未确立,EfficientNet-V2-S的F1=0.786-0.900应视为本队列中的观测估计;40名儿童的单中心样本限制了向更广泛人群的推广;高元音/i/、/u/的梅尔频谱图在持续元音、孤立词和句子中的表现差异尚需进一步分析;不同语言背景、录音设备和评分者一致性对模型的影响仍是开放问题。

来源