利用患者健康状态生成模型识别癌症高风险人群
核心概要
该研究提出GenEHR——一个在数百万患者电子健康记录上训练的自回归生成模型,通过RAdix时间编码显式建模就诊间不规则时间间隔,并结合参数高效的门控低秩适配进行监督微调,在五个大型电子健康记录队列中提升了五年内首次癌症诊断的预测性能,并支持对胰腺癌、卵巢癌等侵袭性癌症进行风险分层筛查。
深度剖析
GenEHR通过RAdix时间编码(RATE)以少量数字令牌在日级分辨率上表示就诊间不规则时间间隔,避免了为每个可能间隔设置单独令牌或使用无事件令牌。 既有方法如ETHOS和CoMET使用固定时间间隔令牌词汇,无法灵活捕捉细粒度间隔;Delphi依赖人工无事件令牌且性能受插入率影响。RATE用27个输出logits覆盖0至4199天,兼顾分辨率与词汇规模。 在五个队列中,生成轨迹的事件患病率与真实数据的log-Pearson相关系数为0.93至0.99,Spearman相关系数为0.90至0.98;生成的就诊间时间间隔与观测间隔的Spearman相关系数为0.89至0.98;时间编码消融显示RATE在预测下一次就诊事件上表现最佳,且在较长间隔上改善最大。
在冻结的GenEHR主干上联合训练癌症风险头和癌症类型特异性门控低秩适配器(gated LoRA),在五个队列、多个预测时间窗上取得了优于直接评分和仅训练风险头的癌症风险判别性能。 直接使用预训练GenEHR的癌症令牌logits即可在没有癌症注册监督的情况下区分病例与对照;加入时间-事件监督后性能显著提升,说明诊断时间监督提供了额外信息。门控LoRA通过共享低秩方向与癌症特异性门控,使罕见癌症能从其他癌症的共享表示中获益。 在MGB队列,跨时间窗宏观AUROC从直接评分的0.71至0.77提升至仅风险头的0.80至0.84和门控LoRA的0.80至0.84;PROV从0.60至0.67提升至0.72至0.77和0.73至0.78;VA从0.67至0.71提升至0.80至0.81和0.82至0.83;AoU从0.58至0.85提升至0.67至0.82和0.68至0.84;UKBB从0.54至0.80提升至0.60至0.92和0.62至0.92。
在临床相关的高风险阈值下,GenEHR-CancerRisk在最高风险的1000名患者中显著富集癌症病例,并给出从预测截点到实际诊断的提前时间分布。 不同于仅报告AUROC,该研究在N=1000的操作阈值下报告SIR、SNS和PPV,直接回应筛查项目需要选择操作阈值以平衡假阳性与真阳性、并考虑医疗系统容量的问题。 在60个月预测时间窗、N=1000阈值下,SIR和SNS范围分别为MGB 18-224和2-96、PROV 6-224和2-136、VA 3-91和6-299、UKBB 3-27和5-570、AoU 4-20和6-322;胰腺癌、卵巢癌和肺癌的SIR分别为34-48、6-22和20-57,SNS分别为13-18、36-136和2-7;中位提前时间范围为5.5至29.8个月,最大提前时间范围为21.4至60个月。
GenEHR学习到的患者和事件表示在无显式临床层级监督下按临床类别组织,并可通过条件点互信息构建事件关系信念图,用于生成癌症前驱事件的假设。 事件嵌入在UMAP投影中按ICD章节、药物ATC类别、实验室检测组和CPT操作章节聚集,并呈现急性与慢性呼吸疾病、扭伤与骨折、上消化道症状与疝及肝胆疾病等细分结构;cPMI信念图显示胰腺疾病和胆道疾病与胰腺癌关联最强,脑癌邻域包含抗癫痫药物和降颅压治疗,髓系白血病邻域包含再生障碍性贫血和骨髓衰竭。 cPMI边反映模型对队列的学习信念而非因果关系;部分边与临床先验知识一致,部分边可生成进一步流行病学或实验研究的假设。
启示与展望
该研究为回顾性分析,基于五个队列的留出测试集评估,结果支持将GenEHR-CancerRisk作为前瞻性临床决策支持工具进行评估,用于优先安排胰腺癌、卵巢癌等侵袭性癌症的风险筛查;模型适用于使用常规收集的结构化电子健康记录数据、具有足够纵向就诊历史的患者群体,且需要在具备癌症注册确认结局的医疗系统中进行本地化训练和校准。
该预印本尚未经同行评审,回顾性结果不能直接推广至临床实践;模型性能在不同癌症类型和队列间差异较大,部分癌症的SNS范围较宽;cPMI信念图的边反映模型学习到的时序关联而非因果关系;电子健康记录诊断编码的准确性在美国医疗系统中仍具挑战;模型未使用临床笔记和医学影像数据;未来需要前瞻性静默评估来检验可靠性、时间漂移、校准以及在不同人口、社会经济和环境亚群中的表现。
