用Oracle筛选的合成眼底图像增强糖尿病视网膜病变分级,ConvNeXt的二次加权kappa从0.6350提升到0.7695,增殖期DR召回率翻倍
核心概要
该研究在辅助数据集上预训练StyleGAN3与Medfusion,并用域匹配的Oracle网络通过潜在空间拒绝采样和类别条件SDEdit升级对合成图像进行严格筛选,随后在印度DR图像数据集上以ConvNeXt、ResNet50、VGG16三种架构和五个随机种子评估下游分级,结果显示仅用真实数据训练的ConvNeXt基线二次加权kappa为0.6350±0.0135,加入筛选后的StyleGAN3合成数据提升至0.7185±0.0309,加入Medfusion合成数据提升至0.7695±0.0254(绝对提升0.1345),且Medfusion将增殖期DR的召回率从0.2615±0.1595提高
深度剖析
严格筛选的合成图像能提升有限数据条件下的DR分级表现,Medfusion增强使ConvNeXt的二次加权kappa从0.6350±0.0135升至0.7695±0.0254,绝对提升0.1345。 此前合成数据增强在DR分级中的增益常受生成模式崩塌与严重度下移限制,本文引入域匹配Oracle网络配合潜在空间拒绝采样与类别条件SDEdit升级进行筛选,把生成质量与下游序数分类性能直接挂钩。 在隔离的下游DR分类任务(印度DR图像数据集)上,跨ConvNeXt、ResNet50、VGG16三种架构并使用五个随机种子评估,报告了均值与标准差。
Medfusion增强将增殖期DR的召回率从0.2615±0.1595提高到0.5385±0.0942,即少数类敏感度翻倍。 多数合成数据工作关注整体准确率,本文明确报告了最严重且样本最少的增殖期DR类别的敏感度变化,直接对应数据不平衡这一临床痛点。 基于五个随机种子的均值与标准差报告,且与仅用真实数据的基线在同一隔离任务上对比。
全局图像质量指标FID未必反映局部病理效用:筛选后的StyleGAN3取得更好的FID(24.25)与填充结构相似度(0.9037),而Medfusion的FID为58.70、填充结构相似度为0.8852但起始分数更高(2.35),最终Medfusion在下游临床性能上更优。 该结果提示评估合成医学图像时,不能仅凭FID等全局指标排序,需要结合下游任务表现与结构多样性来判断。 同时报告了FID、填充结构相似度、起始分数三类生成指标与下游分类指标,形成指标间的对照。
启示与展望
该结果面向数据稀缺与类别不平衡条件下的DR自动分级场景,适用于拥有辅助数据集可预训练生成模型、并能构建域匹配Oracle进行筛选的研究或工程团队;其价值在于为少数类(增殖期DR)提供额外训练信号,从而支持更快速、更敏感的自动化诊断流程。
筛选流程依赖域匹配Oracle网络与辅助数据集,其构建成本与在其他数据集上的可复现性仍需观察;FID与下游性能不一致的现象是否在更多疾病与影像模态中成立,以及增殖期DR召回率提升能否在更大规模、多中心数据上保持,都是值得后续验证的开放问题。
