三种商业人工智能算法在急诊放射科检测颅内出血的回顾性比较
核心概要
这项回顾性研究分析了瑞典西南部一家大型急诊医院的4027例连续非增强头颅CT检查,比较三种商业人工智能算法检测颅内出血的表现,结果显示算法间差异明显,仅Aidoc达到临床相关准确度(敏感度90.3%、特异度99.0%),而将其与人类阅片者以理想化逻辑或模型模拟结合后,敏感度提升至96.0%、特异度维持99.4%(P<0.001),与两名放射科医师相当。
深度剖析
在3902例可评估检查中,176例(4.5%患病率)经两级共识裁定确认为颅内出血,209例被排除,另有8例被两名放射科医师同时漏诊的出血病例被至少一种人工智能系统检出。 该研究在同一批连续急诊非增强头颅CT数据上独立比较三种商业算法,并采用专家手动复核与两级共识裁定作为参考标准,而非仅依赖厂商报告或单一阅片者。 基于4027例连续检查的回顾性设计,所有阳性或不一致病例均经两级共识裁定复核,参考标准较为严格;但属单中心回顾性数据。
三种算法表现差异显著,仅Aidoc展现出临床相关准确度,敏感度90.3%、特异度99.0%。 此前商业颅内出血检测算法的独立临床验证有限,该研究提供了同一数据集下多算法头对头比较的结果。 结果来自同一批连续检查的直接比较,并报告了敏感度与特异度等具体指标;研究为回顾性、单中心设计。
将Aidoc与人类阅片者以理想化逻辑或模型模拟结合后,敏感度提升至96.0%、特异度维持99.4%(P<0.001),与两名放射科医师的表现相当。 该研究不仅评估单一算法,还模拟了人机协同的检测表现,提示联合判读可提升颅内出血检出。 该组合评估基于理想化逻辑或模型,假设放射科医师能完全排除所有人工智能假阳性标记以计算系统特异度,属于模拟而非真实前瞻性工作流程验证。
启示与展望
该研究为单中心回顾性设计,适用于瑞典西南部一家大型急诊医院的连续非增强头颅CT检查场景,其结论面向希望了解商业颅内出血检测算法相对表现及人机协同潜力的急诊放射科读者;人机组合结果基于理想化逻辑或模型模拟,而非真实前瞻性工作流程。
读者可能仍会关注:理想化逻辑或模型假设放射科医师能完全排除所有人工智能假阳性标记,真实工作流程中的表现是否一致尚待前瞻性验证;单中心回顾性数据向其他机构推广的效果;以及三种算法中仅一种达到临床相关准确度这一差异背后的原因。
