跳到主要内容
返回时间线
arXiv来源发表:

从对齐到合成:面向文本到CT生成的对比式体数据视觉语言接地

核心概要

该工作提出一个面向生成的3D-CLIP编码器,用仅在文本层面构造的结构化难负样本(属性感知负样本AAN与语义感知负样本SAN)在体数据编码器小批量约束下增强对比学习,并用其条件化一个直接在3D潜空间运行的端到端潜扩散模型,在CT-RATE的18种病理上取得更低的FID、更高的病理分类AUC与精确率,以及更快的推理速度和更低的显存占用。

Source-provided article image: From Alignment to Synthesis: Contrastive Volumetric Grounding for Text-to-CT Generation
Figure 1 ·

Figure 1: Overview of the proposed Text-to-CT generation framework: (a) 3D-CLIP Training with Generation-Oriented Negatives : A contrastive learning setup aligns CT scans and radiology reports into a shared embedding space. To overcome the limitations of standard in-batch negatives under small batch sizes, training is augmented with two complementary miners: Attribute-Aware Negatives (AAN), which select reports sharing the same pathology but differing in clinical attributes such as laterality, severity, or affected lobe, and Semantic-Aware Negatives (SAN), which retrieve the most semantically confusable reports via nearest-neighbor search in a frozen text embedding space. (b) Diffusion UNet Training : A latent diffusion model is trained to denoise compressed CT representations, conditioned on textual embeddings via cross-attention. A pretrained VAE encoder compresses the volumes into latent vectors, which are noised and passed through a 3D U-Net. (c) Inference : A synthetic latent code is generated from noise using the textual prompt, then decoded into a high-resolution CT volume via the VAE decoder.

arXiv

深度剖析

提出面向生成的3D-CLIP编码器,用AAN与SAN两类文本级难负样本在小批量下提升细粒度语义区分能力。 既有Text-to-CT方法使用仅语言预训练或2D视觉语言预训练的文本编码器,其条件信号在体数据层面是“盲”的;该工作把条件信号显式接地到3D视觉表征,且难负样本只在文本层面构造,不增加3D显存开销。 在CT-RATE上以相同对比目标、相同数据训练,仅增加AAN与SAN,与CT-CLIP构成最直接对照;AAN按侧别、严重程度、肺叶定位等属性筛选并施加标签重叠约束,SAN在冻结的BioClinicalBERT文本空间中取最近邻并排除真阳性;消融显示两种挖掘器单独使用均优于基线,组合最佳。

给出一个完全端到端、直接在3D潜空间运行的文本条件潜扩散框架,避免超分辨率级联带来的空间伪影与跨层不一致。 GenerateCT与MedSyn采用低分辨率生成加超分辨率的级联流程,会引入空间伪影与跨层不一致;该框架用预训练3D VAE压缩体积,在潜空间直接去噪并由VAE解码器还原全分辨率CT。 VAE冻结,测试集重建PSNR为38.87 dB、SSIM为0.963;在2.5D与3D FID上均取得最低值(3D FID为0.015,对比Report2CT的0.053、MedSyn的0.169、GenerateCT的0.166),且推理时间24.26秒/体积、峰值显存19.43 GB为对比方法中最低。

通过固定生成骨干、仅替换条件编码器的消融,建立体数据视觉语言接地质量与下游生成可控性之间的经验联系。 以往工作默认“文本编码器越丰富越好”;该工作把条件组件单独隔离,显示从BioClinicalBERT到3D-CLIP随接地程度提高,FID与分类指标总体单调改善,且分类指标上的差距比FID更明显。 同一生成模型下,BioClinicalBERT的AUC为0.704、精确率0.393,BioMedCLIP为0.666/0.380,Merlin为0.722/0.443,CT-CLIP为0.753/0.471,本文3D-CLIP为0.787/0.535;BioMedCLIP略低于BioClinicalBERT这一例外被归因于其2D异构生物医学图像预训练带来的视觉偏置。

论证仅用图像保真度指标不足以评估文本条件医学图像生成的语义可控性,病理分类等任务导向指标更敏感。 既有评估多依赖FID;该工作显示模型可在低FID下仍系统性忽略条件报告,并给出任务导向指标作为更贴近临床的代理。 在引导尺度从0到15变化时FID 3D保持低位且相对稳定,而精确率随尺度变化并在w=5.0处达到峰值;此外,CT-Net在真实测试数据上AUC(宏平均)为0.821,可作为生成体积分类得分的参照。

启示与展望

该结果面向以放射报告为条件、生成胸部CT体积的研究与工程场景,适用于CT-RATE所代表的胸部CT数据分布与官方划分;其价值在于为“条件信号质量决定语义可控性”这一设计选择提供可复用的训练与评估范式,并让编码器本身可用于零样本病理分类与体积检索等不涉及生成的临床任务。方法依赖成对的文本-体积数据,因此向其他解剖区域或协议扩展的前提是相应配对数据集的可用。

评估仅在CT-RATE上进行,向其他部位与扫描协议的推广仍需验证;难负样本仅在文本层面构造,体积层面的难负样本是否带来额外增益尚待探索;阅片者研究为初步规模(每方法25个体积、一位放射科医师),更大规模、多阅片者、覆盖更广病理表现的正式评估仍是开放方向;此外,本文为全文解析,补充材料中的逐类分解、逐体积统计与下游分类器训练结果未包含在已加载文本中,这些细节会影响对结论稳健性的完整判断。

来源