跳到主要内容
返回时间线
medRxiv来源发表:

多语言非英语临床记录结构化抽取的任务依赖型模型选择

核心概要

该研究在193,101份俄语与哈萨克语卒中出院小结上,以332例章节、149例用药(2,475条参考记录)和191例化验病例为测试队列,比较多语言编码器、本地微调Qwen3-4B与零样本GPT-5.5在实体检测与完整记录组装上的表现,发现章节F1为0.919/0.926/0.932,GPT-5.5在药名检测领先(0.966对0.940),而Qwen在规范化用药记录恢复(0.381对0.311,差值0.070,95% CI 0.026–0.114)与化验五元组F1(0.892对0.822)上领先,并显示从人工整理章节改为原始文档级联后用药恢复由0.377降至0.204(单窗口)与0.246(全块),

AI-generated editorial illustration: Task-dependent model selection for structured extraction from multilingual non-English clinical records

深度剖析

在章节定位这一检测型任务上,紧凑的多语言编码器与生成式模型表现接近:章节跨度F1为编码器0.919、GPT-5.5 0.926、Qwen 0.932,本地减云端差值为0.006(95% CI −0.010至0.021,Holm p=0.804)。 此前临床抽取比较多集中于英语与单一机构数据,且较少在同一语料上同时区分检测与组装;该研究在同一俄语—哈萨克语卒中语料上给出三类模型的同任务、同评分对照。 基于332例共识测试集、1,019条参考跨度,采用文档自助法区间与Holm校正,区间跨越零,说明该任务上差异不明确。

模型优劣随输出要求而反转:GPT-5.5在药名检测上领先(0.966对0.940,本地减云端−0.026,Holm p=0.011),而本地微调Qwen在七字段规范化完整记录恢复上领先(0.381对0.311,差值+0.070,95% CI 0.026–0.114,Holm p=0.002),并在化验五元组F1上领先(0.892对0.822,差值+0.070,95% CI 0.047–0.094)。 该研究把“识别提及”与“连接属性形成完整记录”明确拆分为两个评估目标,并显示同一模型在两类目标上的排序可以不同,这是既有以命名实体识别为主的临床NLP比较较少呈现的。 用药结果基于149例、2,475条参考记录,化验结果基于191例;原始字段恢复在同一队列为0.080/0.173/0.284(编码器/云端/本地),显示结果对规范化规则敏感。

从人工整理章节改为原始文档级联会带来记录级性能损失:用药恢复由匹配整理对照的0.377降至单窗口0.204(变化−0.173,95% CI −0.216至−0.131)与全块0.246(变化−0.131,95% CI −0.180至−0.084),化验五元组F1由0.898降至0.811(变化−0.087,95% CI −0.111至−0.065)。 该研究把组件基准与端到端原始文档评估并列,量化了上游章节抽取与拼接对下游记录组装的影响,而不仅是报告整理输入下的抽取精度。 基于149例用药与191例化验的匹配对照与级联比较,使用文档自助法区间;错误检查还发现药名在供给文本中仍被遗漏,提示上游内容损失与下游生成错误并存。

与第二位标注者的一致性比较显示,生成式模型在规范化完整用药记录上与参考标注的一致程度高于原标注者:A1对A2为0.178,模型减人工差值为云端+0.175(Holm p<.001)、本地+0.172(Holm p<.001);在50份化验报告上人工五元组一致性为0.902,本地模型为0.898,配对差值−0.003(95% CI −0.020至+0.013)。 该研究以标注者一致性作为经验参照来解释模型分数,而非仅报告绝对指标,从而把标注约定与规范化对测量结果的影响纳入讨论。 每任务50例配对留出样本,采用共同第二标注者参考与配对文档自助法区间;样本量有限,作者也将其列为评估范围的一部分。

启示与展望

该结果面向回顾性、离线、单一卫生系统的俄语—哈萨克语卒中出院小结二次利用场景,适用于需要在检测型任务与完整记录组装之间做取舍的机构;它支持按所需记录细节与本地处理条件选择方案,并提示应评估从原始文档到记录的完整通路,而非仅评估整理输入下的抽取。

读者仍需留意:章节测试队列以同时含三个目标标签的文档为主,对缺失章节文档的证据有限;人工比较每任务仅50份报告;患者层面链接不完整,同一患者记录间可能存在重叠;DAPT包含未标注测试文本,且暴露与非暴露组各179与153例、编码器F1均四舍五入为0.919,无法区分暴露效应与组间差异;模型家族、容量、训练暴露、提示、标注歧义与规范化各自的贡献尚未分离;化验宏F1受类别别名与空支持类别影响;运行时间与云端费用覆盖不同硬件与处理范围,且不含治理与人工复核成本;临床工作流效果、安全性与患者获益需另行评估。

来源