跨队列评估甲状腺超声深度学习在不同结局定义下的表现:一项去重控制的基准研究
核心概要
该预印本在去重控制的图像级划分下训练了五个骨干网络(387张甲状腺超声图像、1,332个细针穿刺细胞学图像块,标签来自术后诊断),并将冻结模型分别用于TN3K(n=1,228,数据集自带良恶性标签)和DDTI(n=637,由放射科TI-RADS类别派生的二分类终点),结果显示超声集成模型在TN3K上AUROC为0.825、ResNet-50为0.888,而在TI-RADS派生终点上AUROC仅为0.477和0.437,细胞学基准AUROC为0.986(0.970–0.998)对比超声集成0.733,作者强调由于队列、采集与终点同时变化,这一对比不能归因于标签定义本身。
深度剖析
在图像级划分前用MD5精确哈希与感知哈希对重复与近重复图像分组,使检测到的重复组不再跨越训练、验证与测试划分(原始检测到29行精确重复、33行同感知哈希,分别有3组和4组跨越原划分)。 相对既往甲状腺影像AI研究(如文中表1所列Li等、Peng等、Duc等均未报告泄漏防护),该研究把重复控制作为基准设计的显式环节并公开了分组统计。 基于1,719张图像元数据的哈希分组统计,报告了分组前后跨划分组数;但作者说明该程序无法建立患者级独立性,因为逐图像患者标识不可用。
冻结的超声模型在两个公共队列上表现差异明显:TN3K上集成AUROC 0.825(0.800–0.849)、ResNet-50 0.888(0.870–0.904),而针对DDTI的TI-RADS派生终点AUROC为0.477(0.434–0.523)和0.437(0.391–0.482)。 该研究把“对恶性结局的判别”与“对超声风险分层的吻合度”明确拆成两个不同问题来评估,而不是把二者混为一次外部验证。 外部评估未重训练、未调整阈值,区间来自2,000次自助重采样;作者指出队列、设备、采集、预处理、疾病谱与终点同时变化,因此该对比不能因果归因于标签语义。
在开发档案内部,细胞学基准的判别力高于超声基准:细胞学ConvNeXt-Small AUROC 0.988、四模型集成0.986(0.970–0.998),超声EfficientNet-B3为0.745(0.612–0.865),描述性非配对AUROC差为0.247(0.120–0.384)。 该对比在同一档案内以头对头方式报告两种模态,但明确声明为非配对、非患者配对,因此不构成模态临床优越性的证据。 细胞学测试划分为200张图像、超声为60张图像,均非经核实的独立患者;差异使用5,000次独立重采样,作者称其为描述性。
两项方法学附加分析给出可复用的操作信号:自动纹理/中心ROI裁剪把超声AUROC从0.745提升到0.817、Brier从0.265改善到0.199;温度缩放(T=2.414)在AUROC/AUPRC不变的情况下把ECE从0.0317降到0.0138、NLL从0.2150降到0.1262。 把预处理与概率校准作为独立可检验的环节报告,并说明自动裁剪不等同于专家结节分割、校准后阈值需重新选择。 两项均为探索性分析,基于同一小规模超声测试划分(n=60)与细胞学测试划分(n=200),作者将其定位为假设生成性质。
启示与展望
该基准适用于图像级、二分类(良性 vs 甲状腺乳头状癌)场景,输入为224×224分辨率,开发标签来自术后诊断,外部评估分别使用TN3K自带良恶性标签与DDTI的TI-RADS派生分组;其价值在于为跨队列评估、重复控制与概率校准提供可复现的操作范例,供影像AI研究者与报告规范制定者参考。
读者仍需留意:逐图像患者标识缺失使患者级独立性无法确认,内部估计可能偏乐观;TN3K的公开文档未确立每张分类图像均有病理确认;DDTI的TI-RADS分组不是所有结节的恶性参考标准;队列、采集与终点同时变化使标签语义效应无法单独估计;自动ROI裁剪与Grad-CAM均为探索性且未经专家复核;此外本次读取为不完整范围,图1至图3的具体内容与附录A的指标定义未能核对,若这些材料包含影响解读的细节,需回到原文确认。
