arXiv 2026年9月24日该工作提出一种检索增强的文本到CT生成方法:给定放射学报告,用预训练3D视觉语言编码器从参考语料中检索语义最相近的病例,把该病例的解剖标注作为结构代理,经ControlNet分支注入文本条件潜扩散模型;在CT-RATE数据集(27,514例训练、1,818例测试)上,检索增强生成在图像保真度(FID 3D 0.004)、临床一致性(CT-Net AUC 0.787)和空间可控性(Dice 0.772、HD95 3.072)上均优于纯文本基线,并首次为这类方法带来显式空间可控性。该工作提出一种检索增强的文本到CT生成方法:给定放射学报告,用预训练3D视觉语言编码器从参考语料中检索语义最相近的病例,把该病例的解剖标注作为结构代理,经ControlNet分支注入文本条件潜扩散模型;在CT-RATE数据集(27,514例训练、1,818例测试)上,检索增强生成在图像保真度(FID 3D 0.004)、临床一致性(CT-Net AUC 0.787)和空间可控性(Dice 0.772、HD95 3.072)上均优于纯文本基线,并首次为这类方法带来显式空间可控性。检索增强的解剖引导让文本生成CT在保真度、临床一致性与空间可控性上同时超过纯文本基线该工作提出一种检索增强的文本到CT生成方法:给定放射学报告,用预训练3D视觉语言编码器从参考语料中检索语义最相近的病例,把该病例的解剖标注作为结构代理,经ControlNet分支注入文本条件潜扩散模型;在CT-RATE数据集(27,514例训练、1,818例测试)上,检索增强生成在图像保真度(FID 3D 0.004)、临床一致性(CT-Net AUC 0.787)和空间可控性(Dice 0.772、HD95 3.072)上均优于纯文本基线,并首次为这类方法带来显式空间可控性。该工作提出一种检索增强的文本到CT生成方法:给定放射学报告,用预训练3D视觉语言编码器从参考语料中检索语义最相近的病例,把该病例的解剖标注作为结构代理,经ControlNet分支注入文本条件潜扩散模型;在CT-RATE数据集(27,514例训练、1,818例测试)上,检索增强生成在图像保真度(FID 3D 0.004)、临床一致性(CT-Net AUC 0.787)和空间可控性(Dice 0.772、HD95 3.072)上均优于纯文本基线,并首次为这类方法带来显式空间可控性。