跳到主要内容
返回时间线
Journal of Zhejiang University(Science Edition)来源发表:

可解释多模态深度学习框架:融合MRI、PET与临床数据的三分类阿尔茨海默病诊断

核心概要

该研究在ADNI数据上构建了一个基于ResNet50迁移学习的患者级多模态融合框架,将MRI与PET影像特征与临床变量(ADAS11、ADAS13、APOE4、年龄、性别、教育年限、MMSE总分)拼接后经全连接网络输出AD/MCI/CN三分类,并以Grad-CAM生成热力图;消融实验显示准确率随模态增加而上升,MRI单模态39.61%、PET单模态51.72%、仅临床66.67%、MRI+PET 54.17%、三模态融合79.17%(24例患者测试集,95% Wilson区间约59.5%–90.8%),其中加入临床数据带来最大单次提升。

AI-generated editorial illustration: An Explainable Multimodal Deep Learning Framework for Alzheimer's Disease Classification Using MRI, PET, and Clinical Data

深度剖析

提出并验证了一个把MRI、PET与临床变量同时纳入的患者级特征级融合框架,用于AD/MCI/CN三分类而非二分类。 作者在表I的定性对比中指出,此前融合MRI与PET的研究(Odusami、Zhang、Song、Goel、Castellano)均不含临床数据,唯一使用临床数据的El-Sappagh等则完全不含影像,因此三模态加三分类加Grad-CAM的组合在既有文献中尚无先例。 证据来自ADNI数据的五组配置消融实验(表IV、表V),但患者级融合结果基于24例留出测试集,作者同时报告了95% Wilson置信区间并说明区间较宽。

消融实验量化了各模态的边际贡献,发现临床变量在该队列中单独即优于任一影像模态及其组合。 作者将Clinical-only基线(66.67%)纳入表V,指出其高于MRI(39.61%)、PET(51.72%)与MRI+PET(54.17%),并说明既有研究通常未在单一消融中隔离临床数据的独立贡献。 基于同一24例患者级测试集;作者报告Fisher精确检验结果:MRI+PET(13/24)对比三模态(19/24)p=0.125,Clinical-only(16/24)对比三模态(19/24)p=0.517,并说明因未保留逐患者配对记录而采用非配对检验,属保守估计。

在影像分支上集成Grad-CAM并配套交互式诊断界面,输出预测类别、置信度、各类概率、基于类别条件图谱查询的受累脑区列表与通俗解释文本。 作者通过类别条件诊断检验说明PET分支的Grad-CAM响应随被解释类别变化:对同一张PET切片分别按AD、CN、MCI三种假设计算热力图,三者并不相同(AD假设下激活偏向右半球,CN假设下热点位于下中央区,MCI假设下激活几乎缺失)。 属三个代表性正确分类病例的定性检查,作者明确说明这是示例性单例而非系统性评估,且受累脑区标签来自固定查找表而非由热力图坐标计算。

采用轻量的2D切片级ResNet50骨干加均值池化聚合到患者级,避免3D卷积或Transformer架构的计算开销。 作者在表I对比中指出,多数融合框架依赖计算密集的3D卷积端到端训练,本框架以特征级拼接融合替代,并明确将切片聚合方式(中心50层切片特征平均)标注为设计选择而非附带细节。 方法描述完整(III-D至III-G),但作者指出最大池化、注意力加权池化或对softmax概率聚合等替代方案可能带来不同的下游融合表现,验证留作未来工作。

启示与展望

该框架面向ADNI队列中AD/MCI/CN三分类的研究场景,适用于具备MRI、FDG-PET与结构化临床评估(ADAS11、ADAS13、APOE4、年龄、性别、教育、MMSE)三类数据的受试者;影像分支在切片级评估(MRI n=1608、PET n=696),融合分支在患者级评估(n=24)。作者指出,扩大队列、引入3D卷积或Vision Transformer以利用体数据空间上下文、加入CSF或遗传风险等生物标志物、开展纵向多扫描分析,以及在多机构间采用联邦学习,都是该框架可延伸的方向。

读者可留意:患者级融合的79.17%点估计在24例测试集上的稳定性尚待更大、多中心队列确认;消融中临床数据带来的25点提升与Clinical-only相对三模态的12.5点残差增益,因未保留逐患者配对记录而只能用非配对Fisher检验,统计功效受限;Grad-CAM热力图在MRI上三类形状相似并延伸至颅骨外周结构,PET上仍有贴近脑掩膜内边界的孤立激活块,作者将其归因于末层卷积特征图上采样时缺少更紧的脑组织掩膜,因此尚不宜用于精确解剖定位;受累脑区标签来自固定类别条件查找表而非热力图坐标计算;可解释性分析仅覆盖三个代表性病例,缺少全队列的定量重叠分析。此外,本次读取的文本中实验环境未给出具体硬件与库版本号,作者说明将在定稿版本中补充。

来源