ICHOR用11405例ASL脑血流图自监督预训练,在四项下游任务上整体优于结构MRI预训练基线
核心概要
该研究提出ICHOR,一种基于3D掩码自编码器(ViT-Base编码器加轻量解码器)的ASL脑血流(CBF)图自监督预训练框架,在来自14项研究、多站点多协议的11405例ASL CBF扫描上预训练,并在三项诊断分类任务和一项ASL CBF图质量预测回归任务上评估,结果显示其在四项任务上整体优于BrainIAC、BrainSegFounder和MedicalNet等结构MRI预训练基线。
Fig. 1. Overview of the presented study.
· 第 3 页深度剖析
ICHOR为ASL衍生的CBF图提供了专门的预训练编码器,填补了此前神经影像预训练模型主要面向结构或多对比度解剖MRI、未纳入ASL等生理成像模态的空白。 此前BrainIAC、BrainSegFounder等大规模脑MRI预训练模型聚焦结构成像,ASL CBF缺乏专用预训练骨干;ICHOR以3D掩码自编码器在ASL CBF图上做掩码图像建模,学习可迁移表征。 论文以ViT-Base编码器(12个transformer块、12个注意力头、MLP维度3072)加4块轻量解码器实现,输入为配准到MNI空间、重采样至96×96×96的CBF体积,划分为512个12×12×12的3D patch,掩码比例ρ=0.5,仅对掩码patch计算MSE损失。
研究构建了迄今规模最大的ASL数据集之一,用于跨异质采集设置的预训练。 该数据集包含11405例ASL CBF扫描,来自14项研究,覆盖多站点、多协议(PASL/PCASL、2D/3D、单/多延迟)和异质人群,为ASL预训练提供了此前缺乏的大规模多站点资源。 表A1列出各数据集样本量(如UKB 5383例、PNC 1397例、ADNI 966例等),合计11405例,年龄范围0–100岁,女性占54.7%;所有扫描经自动化工具质控,并按标准化流程预处理。
在四项下游任务上,ICHOR整体优于结构MRI预训练的神经影像自监督基线。 与BrainIAC、BrainSegFounder、MedicalNet相比,ICHOR在CU Aβ−对CI Aβ+分类(AUC 78.93%)、HOA对SVD分类(AUC 73.33%)、AD对bvFTD分类(AUC 100.00%)和ASL质量预测(R2 86.29%、PC 93.11%)上整体表现最佳。 采用嵌套5折交叉验证,每折留出独立测试集,内部80%/20%分层训练/验证划分;下游适配使用LoRA(rank r=8、αLoRA=16、dropout p=0.2),结果报告为五个外层折的均值。
掩码比例对下游性能存在非单调影响,ρ=0.5在多数指标上取得最佳下游表现。 研究比较了ρ∈{0.25, 0.5, 0.75},发现提高ρ使重建视觉上更清晰,但下游性能并不随重建质量单调提升;在CU Aβ−对CI Aβ+任务上ρ=0.5的AUC为78.93%,高于ρ=0.25的76.74%和ρ=0.75的71.90%。 该比较在相同下游训练协议下进行,结果见表2;论文将其解释为低掩码使重建目标信息量不足、高掩码使可见上下文不足的权衡。
启示与展望
该工作面向ASL衍生CBF图的分析,适用于研究场景与临床MRI协议中日益增多的ASL采集;其预训练语料覆盖多站点、多协议(PASL/PCASL、2D/3D、单/多延迟)与异质人群,下游评估使用与预训练数据独立的机构队列。ICHOR被设计为通用编码器,可经LoRA适配到分类与回归任务,作者提出未来可扩展到去噪、伪影校正等质量增强任务,以及纵向疾病进展与治疗反应建模,并进一步扩充预训练语料以增强跨人群、协议和扫描平台的泛化。
下游队列样本量较小(如HOA n=20、SVD n=15、AD n=27、bvFTD n=36),部分任务指标在折间可能存在波动;随机初始化基线在部分设置下取得更高召回与F1,论文将其部分归因于小队列过拟合与LoRA在强模态不匹配下的适配限制,这一解释仍属推测。掩码比例与下游性能的关系目前主要在单一分类任务上量化,是否推广到其他任务尚待观察。此外,预训练权重与代码在文中表述为“将公开”,其实际可用性与复现细节需以发布为准。
