跳到主要内容
返回时间线
arXiv来源发表:

EviGen:以预测性证据脚手架生成可验证的临床推理依据

核心概要

EviGen 提出一个三层框架,先用基于结局标签训练的可学习查询按预测贡献(而非文本相关性)检索并排序患者纵向电子健康记录中的证据,再让大语言模型在该证据脚手架内生成带引用编号的临床推理依据,最后由过程监督验证器逐步核查并标记不可靠推理;在 MIMIC-IV 一年死亡率、自闭症与 ADHD 三个任务上,其预测表现与推理依据忠实度优于全上下文与 RAG 基线,并在临床评审试点中被多数评审者首选。

Source-provided article image: EviGen: Predictive Evidence Scaffolding for Verifiable Clinical Rationale Generation
Figure 2 ·

Figure 2: EviGen three-layer pipeline. (a) Evidence Selection Layer (§ 3.2 ); (b) Rationale Generation Layer (§ 3.3 ); (c) Process Verification Layer (§ 3.4 ).

arXiv

深度剖析

提出面向完整纵向电子健康记录的三层可验证临床推理框架,把预测、推理生成与验证串联在同一份患者特异证据上。 作者称这是首个面向跨越数年患者照护记录的临床推理依据生成框架,此前工作多针对单次就诊或文档分类。 以框架设计与三个任务上的端到端实验支撑,含与全上下文、RAG 及多种监督基线的对比。

用可学习查询作为证据探测器,并按患者动态激活,从而在任意长输入上高效检索异质证据(临床笔记与 ICD 编码)。 相较固定查询集的 IRIS,引入患者条件化门控,只激活与患者画像匹配的查询;相较 RAG,检索由预测效用而非文本相似度驱动。 与 IRIS 的对比即门控的精确消融,EviGen 在三个数据集上均优于 IRIS,差距在更长的自闭症与 ADHD 数据上扩大到 2.7–3.5 个百分点。

以证据脚手架约束生成,使每一步推理都引用可回溯到原始记录的引文,并附有符号化归因分数。 把预测性证据检索从文档分类扩展到引导生成,使推理依据可被机械核验(引文编号与逐字引用)。 匹配的 2×2 实验显示,加入证据脚手架使联合通过率提升 9.7–21.2 个百分点,改用 IG 排序证据再提升 3.4–11.6 个百分点。

过程监督验证器在推理步骤层面标记不可靠主张,并给出错误类型。 把过程监督范式从临床笔记验证迁移到临床推理依据的审计,输出类型化错误标记。 步骤级二分类 AUROC 0.978,校准后 F1 0.947、ECE 0.028,错误类型判定准确率 88.2%;在自然生成推理依据上的排序评估中,最低分组的忠实度通过率比其余九组平均低 11.81 个百分点。

启示与展望

该工作面向需要整合跨时间稀疏证据的纵向临床预测任务,适用于结局标签可从结构化字段获得、且记录长度可能超出模型上下文的情形;作者指出未来可扩展到实验室数值与临床影像等更多模态,并考虑把验证器嵌入生成循环而非仅做事后检查。临床效用结论目前来自 7 名医学生的试点评审,作者说明需要由执业临床医生参与、规模更大的研究来进一步确认,相关研究正在进行中。

验证器在自然生成推理依据上的评估采用基于评判模型的排序而非人工标注的步骤级标签,作者也说明尚未开展检验“展示验证标记是否改善人工复核质量或效率”的对照读者研究,因此验证器应视为初步筛查工具。临床评审试点规模小且评审者为尚未执业的医学生,其结论为初步证据。自闭症与 ADHD 队列来自机构内部受保护数据、无法共享,MIMIC-IV 部分可完全复现;作者提到未在年龄截断前穷尽审计与目标相关的自由文本提及。此外,阴性标签表示可用记录中无目标诊断,而非确认终身无该病症。

来源