超越词错误率:以临床风险作为环境AI记录评估的必要标准——来自77种语言的证据
核心概要
该研究构建了一个多语言临床听写语料库(五份复杂度递进的临床听写脚本,翻译成99种语言,在三种声学条件下合成语音,由一套生产环境AI记录系统转写),计算六种频率类指标,并由三个独立的大语言模型评分者依据严重度×可能性框架评估临床上有意义的错误模式;在59,819次真实转写错误中,58,329次(97.5%)为低风险,251次(0.42%)为危急或高风险,六种频率指标均未显示与严重临床风险存在可检测的关联(绝对Spearman rho < 0.16),而严重度×可能性之和仍与WER强相关(rho=0.80),咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。
深度剖析
在受控多语言语料库中,聚合的频率类转写指标无法可靠追踪临床上有后果错误的稀疏严重尾部。 以往环境AI记录评估主要依赖WER等频率指标,本研究直接检验这些指标是否随有临床后果的转写错误而变化,发现六种频率指标与严重临床风险之间没有可检测的关联(绝对Spearman rho < 0.16)。 基于59,819次真实转写错误,由三个来自外部供应商的独立大语言模型评分者使用严重度×可能性框架评估,该框架参考了英国数字临床安全风险管理原则。
严重度×可能性之和与WER强相关(rho=0.80),表明聚合指标仍被良性错误主导。 这说明即使引入风险加权的聚合评分,其变异仍主要来自大量低风险错误,而非少数危急或高风险错误。 在59,819次错误中,58,329次(97.5%)为低风险,仅251次(0.42%)为危急或高风险,严重尾部极为稀疏。
在复杂度等级3,低资源语言的WER比高资源语言更差(beta=+0.078,95% CI +0.045至+0.111;p < 0.0001),但危急或高风险没有可检测的差异(OR 1.21,95% CI 0.43至3.43;p=0.72)。 这提示语言资源水平影响转写频率质量,却未必同步影响临床后果风险,二者需要分开评估。 基于多语言语料库中复杂度等级3的分层比较,报告了效应量、置信区间与p值。
咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。 将严重风险的驱动因素从语言或声学条件转向咨询本身的复杂度,为风险分层提供了新的关注点。 在受控语料库中跨复杂度梯度分析,报告了比值比与p值。
启示与展望
该研究适用于受控多语言语料库中的环境AI记录转写评估,尤其是需要区分转写质量与临床安全性的场景;对希望补充频率指标、引入情境感知错误后果评估的开发者、评估者与临床安全管理者具有参考价值。
严重尾部极为稀疏(251次危急或高风险,占0.42%),可能限制对严重风险关联的统计检测能力;结果基于合成语音与单一生产系统,真实临床环境中的表现仍需观察;三个大语言模型评分者的评估与英国数字临床安全风险管理原则的一致性程度,以及不同评分者之间的一致性,是读者可以继续关注的问题。
