跳到主要内容
返回时间线
medRxiv来源发表:

SNOMED CT 上的混合词法-语义检索:让两种检索范式共存以支持临床数据录入

核心概要

该工作提出并实现了一套在 SNOMED CT 官方描述之上让确定性词法检索与学习式语义检索共存的混合检索架构,结合多前缀搜索、BioLORD-2023-M 嵌入、可选 BGE 交叉编码器重排与本地 LLM 查询规范化,并用倒数排名融合与层级过滤整合结果;在 DisTEMIST 西班牙语 542 条疾病提及的零样本仅检索链接评测中,语义检索加重排且不做 LLM 预处理的配置取得 accuracy@1 为 0.60、recall@10 为 0.80,在英文真实 EHR 出院记录 12,897 条提及的字段限定 typeahead 评测中,73% 的提及其概念进入前十候选列表(accuracy@1 为 0.52),并显示两路通道可共存而不互相损害。

Source-provided article image: Hybrid lexical-semantic retrieval over SNOMED CT: combining two retrieval paradigms to facilitate clinical data entry
Figure 1 ·

Figure 1 summarizes these functions and the flow between them.

medRxiv · 第 7 页

深度剖析

提出一种让词法检索与语义检索在同一检索流程中共存、而非二选一的参考架构,并在 SNOMED CT 国际版上给出可复现实现。 以往避免引入语义通道的做法是加强词法通道,即额外维护本地接口词表,而该工作改为在 SNOMED CT 自身维护的描述之上计算额外访问路径。 在 SNOMED CT 国际版上实现了一个可复现实例,包含确定性多前缀搜索、BioLORD-2023-M 嵌入、可选 BGE 交叉编码器与本地 LLM(gemma 4),并以倒数排名融合与层级过滤整合。

在 DisTEMIST 西班牙语零样本仅检索链接评测中,语义检索加重排且不做 LLM 查询预处理的配置表现最好且计算最省。 该配置在 542 条疾病提及上取得 accuracy@1 为 0.60、recall@10 为 0.80,且这些数字基于金标准提及跨度,将规范化与提及检测分离,因此与 DisTEMIST 共享任务的端到端分数不可直接比较。 外部评测基于 542 条疾病提及,通过 SNOMED CT 历史关联解析金标准编码,并对查询预处理、重排以及各检索通道分别做了消融。

两路通道可以共存而不产生取舍:在该规范化干净的语料上,语义通道承担了准确率,加入词法通道既未提升也未损害。 accuracy@1 在 0.60 与 0.61 之间,原因是倒数排名融合之后的重排会抑制偏离任务的通道;词法通道自身的强项即部分按输入原样键入的场景,并非该语料所测试的范围。 通过单独隔离各检索通道的消融实验得到,并辅以近失分析显示许多剩余案例检索到的是目标概念的父概念或子概念。

在英文真实 EHR 出院记录上,字段限定的 typeahead 能把多数提及的概念放入前十候选,且上下文感知预处理可作为选择性补救。 在 12,897 条提及上,73% 进入前十候选列表(accuracy@1 为 0.52,findings 为 0.54,接近 DisTEMIST);残余错误多为软错误,硬性漏检主要由歧义的 EHR 缩写造成,而一次上下文感知预处理调用可将这些硬性漏检的恢复率大致翻倍,但对每条提及都应用会因扰动容易的多数而略微降低整体准确率。 基于 SNOMED CT Entity Linking Challenge 的英文真实 EHR 出院记录语料,共 12,897 条提及,覆盖所有临床领域,并测试了上下文感知预处理。

启示与展望

该结果面向在 SNOMED CT 官方维护描述之上构建检索服务的场景,适用于希望在不额外维护本地接口词表的前提下支持直接搜索的临床数据录入流程;作者指出在选定的引导式工作流中,人工维护的接口词表仍然有用。所报告的数字针对所评估的具体配置,而非与架构无关的估计。

词法通道自身的强项即部分按输入原样键入的场景,并非该语料所测试的范围,因此两通道共存是否在该场景下同样无取舍仍待观察;LLM 查询预处理对脏的、口语化输入有帮助,但对干净的术语式查询略有损害,上下文感知预处理对每条提及都应用会略微降低整体准确率,因此其选择性使用的触发条件值得进一步关注;此外,仅检索指标基于金标准提及跨度,与端到端分数不可直接比较,端到端表现仍有待观察。

来源