检索增强的解剖引导让文本生成CT在保真度、临床一致性与空间可控性上同时超过纯文本基线
核心概要
该工作提出一种检索增强的文本到CT生成方法:给定放射学报告,用预训练3D视觉语言编码器从参考语料中检索语义最相近的病例,把该病例的解剖标注作为结构代理,经ControlNet分支注入文本条件潜扩散模型;在CT-RATE数据集(27,514例训练、1,818例测试)上,检索增强生成在图像保真度(FID 3D 0.004)、临床一致性(CT-Net AUC 0.787)和空间可控性(Dice 0.772、HD95 3.072)上均优于纯文本基线,并首次为这类方法带来显式空间可控性。
Fig. 1: The proposed retrieval-augmented Text-to-CT generation framework.
· 第 3 页深度剖析
把解剖结构重新表述为可检索的潜在代理,而非推理时必须提供的直接条件输入。 此前的结构驱动方法(如MAISI)在推理时需要真实分割掩膜,而纯文本方法缺乏空间约束;该工作用检索到的相关病例标注作为粗略空间支架,使推理阶段无需目标体积的标注。 方法在CT-RATE上实现,检索仅在训练集上进行,测试集报告不进入检索索引、测试集掩膜不作为条件输入,作者称这确保了评估时无信息泄漏。
通过ControlNet分支将检索到的解剖代理注入冻结的文本条件潜扩散模型,在保留报告驱动语义可变性的同时施加全局解剖一致性。 扩散主干与视觉语言编码器保持冻结,仅训练控制分支与零初始化投影层,零初始化使训练开始时残差近似为零,从而恢复原始预训练生成器。 控制特征在所有下采样层与瓶颈层注入,条件尺度固定为1.0(在[0.5, 2.0]范围内扫描选定),文本条件使用无分类器引导、尺度5.0,采样采用30步rectified flow,控制分支训练50个epoch。
检索增强生成在三个互补评价轴上均优于纯文本基线,并额外获得显式空间可控性。 纯文本条件方法本身不具备空间可控性;该工作在FID 3D上取得0.004(对比Text-to-CT的0.015、MAISI的0.012),在CT-Net上AUC达0.787(对比Text-to-CT的0.745),Dice达0.772、HD95为3.072。 结果基于CT-RATE官方划分,统计显著性由5个不同随机种子的配对Wilcoxon符号秩检验给出(p<0.05);真实CT的CT-Net AUC为0.824,作为参考上界。
检索质量对生成性能有系统性影响,语义对齐的代理带来一致增益。 消融比较语义最近、语义最远与随机检索三种代理选择策略,且所有配置共享同一生成主干,仅推理时的代理选择准则不同。 语义最近检索在临床一致性与空间可控性上表现最强,随机与最远检索性能下降;作者指出检索质量对低层外观统计影响较小,对高层语义与解剖对齐影响更明显。
启示与展望
该结果面向胸部CT的报告条件合成场景,适用于参考语料中已有带解剖标注病例、且检索可在训练集内完成的情形;它为数据增强、仿真与隐私感知学习提供了一条无需推理期标注即可获得解剖引导的路径,并可通过替换参考语料与标注类型扩展到其他解剖区域或模态。作者指出后续工作将考察病理特异性评估与纵向场景,利用时间相关的先验建模疾病进展。
检索代理被明确定义为粗略空间支架而非目标解剖的精确模板,因此空间可控性衡量的是对所提供的支架的贴合程度,而非相对于未知真实解剖的正确性;作者也指出一个简单复制代理的模型会在空间指标上得分很高却在临床一致性上退化,说明三类指标需互补解读。检索质量的作用在低层外观统计上较温和、在高层语义与解剖对齐上更明显,这一差异的边界仍有待进一步刻画。此外,本文验证限于胸部CT与CT-RATE,病理特异性评估与纵向场景被列为未来工作,尚不清楚在其他解剖区域或标注体系下结论是否保持。
