medRxiv 2026年9月14日该研究构建了一个多语言临床听写语料库(五份复杂度递进的临床听写脚本,翻译成99种语言,在三种声学条件下合成语音,由一套生产环境AI记录系统转写),计算六种频率类指标,并由三个独立的大语言模型评分者依据严重度×可能性框架评估临床上有意义的错误模式;在59,819次真实转写错误中,58,329次(97.5%)为低风险,251次(0.42%)为危急或高风险,六种频率指标均未显示与严重临床风险存在可检测的关联(绝对Spearman rho < 0.16),而严重度×可能性之和仍与WER强相关(rho=0.80),咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。该研究构建了一个多语言临床听写语料库(五份复杂度递进的临床听写脚本,翻译成99种语言,在三种声学条件下合成语音,由一套生产环境AI记录系统转写),计算六种频率类指标,并由三个独立的大语言模型评分者依据严重度×可能性框架评估临床上有意义的错误模式;在59,819次真实转写错误中,58,329次(97.5%)为低风险,251次(0.42%)为危急或高风险,六种频率指标均未显示与严重临床风险存在可检测的关联(绝对Spearman rho < 0.16),而严重度×可能性之和仍与WER强相关(rho=0.80),咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。超越词错误率:以临床风险作为环境AI记录评估的必要标准——来自77种语言的证据该研究构建了一个多语言临床听写语料库(五份复杂度递进的临床听写脚本,翻译成99种语言,在三种声学条件下合成语音,由一套生产环境AI记录系统转写),计算六种频率类指标,并由三个独立的大语言模型评分者依据严重度×可能性框架评估临床上有意义的错误模式;在59,819次真实转写错误中,58,329次(97.5%)为低风险,251次(0.42%)为危急或高风险,六种频率指标均未显示与严重临床风险存在可检测的关联(绝对Spearman rho < 0.16),而严重度×可能性之和仍与WER强相关(rho=0.80),咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。该研究构建了一个多语言临床听写语料库(五份复杂度递进的临床听写脚本,翻译成99种语言,在三种声学条件下合成语音,由一套生产环境AI记录系统转写),计算六种频率类指标,并由三个独立的大语言模型评分者依据严重度×可能性框架评估临床上有意义的错误模式;在59,819次真实转写错误中,58,329次(97.5%)为低风险,251次(0.42%)为危急或高风险,六种频率指标均未显示与严重临床风险存在可检测的关联(绝对Spearman rho < 0.16),而严重度×可能性之和仍与WER强相关(rho=0.80),咨询复杂度是严重风险的主要预测因素(每级OR 3.06,p < 0.0001)。