分层时序 Transformer:从病理报告预测癌症分级并实现跨癌种迁移
核心概要
本文提出分层时序 Transformer(HTT),第一层用 LoRA 适配的 BiomedBERT 编码单份报告,第二层用时序 Transformer 结合以就诊间隔天数构建的连续时间位置编码和可学习的癌种嵌入读取患者完整报告序列;在受控合成连续影像报告语料上验证 AUROC 达 0.942(单报告基线 0.881),迁移到留出的胰腺癌达 0.995(基线 0.949),在 TCGA-Reports 的 4,786 份真实病理报告、14 个癌种上对三个完全未参与训练的癌种预测肿瘤分级,AUROC 分别为甲状腺癌 1.000、肉瘤 0.960、肺鳞癌 0.808,留出癌种平均 AUROC 0.923 与分布内测试 AUROC 0.923 持平,消融
深度剖析
HTT 用两层结构同时处理报告序列的时间演化与跨癌种泛化:第一层以 LoRA 适配 BiomedBERT 编码单份报告,第二层用时序 Transformer 读取患者完整报告序列。 相对逐份孤立阅读报告的既有语言模型,该架构显式建模患者多次就诊之间的疾病变化,并用可学习癌种嵌入提供按癌种家族的条件化。 架构描述完整,两层分工明确;在合成语料与真实语料两类数据上分别检验两种能力。
在受控合成连续影像报告语料上,HTT 验证 AUROC 为 0.942,单报告基线为 0.881;迁移到留出的胰腺癌为 0.995,基线为 0.949,而两者在 60 例患者测试集上无法区分。 该实验把时序建模能力与跨癌种迁移能力分开检验,因为不存在覆盖多癌种纵向报告的完全开放语料。 合成语料中进展短语按模板轨迹插入,属受控设置;胰腺癌迁移结果与 60 例测试集上的不可区分性并列报告。
在 TCGA-Reports 的 4,786 份真实病理报告、14 个癌种上,HTT 对三个完全未参与训练的癌种预测肿瘤分级,AUROC 为甲状腺癌 1.000、肉瘤 0.960、肺鳞癌 0.808,留出癌种平均 AUROC 0.923 与分布内测试 AUROC 0.923 相等。 既有评估通常只覆盖训练数据中出现的癌种,该结果把评估扩展到完全留出的癌种家族,且未观察到可测量的迁移损失。 基于真实病理报告语料,样本量为 4,786 份、覆盖 14 个癌种,并报告了留出与分布内 AUROC 的对照。
在真实语料上的消融显示,迁移能力主要由预训练编码器承担,而非时序组件;在每位患者仅一份报告的情况下,时序组件贡献 0.39 个 AUROC 点。 该消融把迁移来源归因到预训练编码器,说明与分级相关的病理语言可能以癌种无关的方式被学习。 消融在真实语料上进行,并明确给出时序组件在单报告情形下的贡献量。
启示与展望
该结果面向从病理报告预测肿瘤分级并跨癌种迁移的场景,适用于具备患者多次就诊报告序列或单份报告的真实语料,以及用于分离检验两种能力的受控合成语料;其意义在于指向无需按癌种重新训练的统一癌症 NLP 系统。
读者仍会关注:在每位患者仅一份报告的真实语料中,时序组件仅贡献 0.39 个 AUROC 点,时序建模在真实纵向数据上的作用尚待更多证据;合成语料中进展短语按模板轨迹插入,其结论向真实临床轨迹的推广程度是开放问题;此外,本次加载为摘要级文本,缺少图表与完整方法细节,可能影响对实验设置与结果细节的完整把握。
