AI-RADS 框架让 5 名放射科医师对 350 例 AI 输出分级,图像与生成任务的读者间一致性分别达 α=0.87 与 0.93
核心概要
该研究开发并多读者评估了 AI-RADS——一个用于在病例层面评估放射学 AI 输出可靠性、临床实用性与建议处置的结构化框架,5 名委员会认证放射科医师独立评估了 7 个代表性 AI 应用处理的 350 例病例,每例赋予 5 个 AI-RADS 类别之一、适用修饰符及独立正确性评级作为参照,结果显示图像类任务的核心类别读者间一致性为 Krippendorff's α=0.87(95% CI: 0.83-0.91),生成式 AI 任务为 α=0.93(95% CI: 0.91-0.95),读者判定的正确性与提示可整合入临床工作流的类别 1 至 2 吻合良好,被评为“错误”的输出主要归入需要覆盖或从显示中移除的类别 4 至 5。
深度剖析
研究提出 AI-RADS,一个在病例层面评估 AI 输出可靠性、临床实用性与报告沟通后果的结构化框架,包含 5 个核心类别与适用修饰符。 原文背景指出,尽管放射学中 AI 应用日益增多,此前并不存在用于评估其病例层面可靠性或记录被覆盖输出的结构化框架。 框架通过回顾性多读者研究进行测试,5 名委员会认证放射科医师对 350 例病例独立评级,每例同时获得独立正确性评级作为参照。
核心 AI-RADS 类别在图像类与生成式 AI 任务中均取得显著读者间一致性。 该结果为框架的可重复使用提供了量化依据,而不仅是概念性提议。 图像类任务 Krippendorff's α=0.87(95% CI: 0.83-0.91),生成式 AI 任务 α=0.93(95% CI: 0.91-0.95),基于 5 名读者与 350 例病例。
读者判定的正确性与 AI-RADS 类别之间存在方向一致的对应关系:正确输出对应可整合入临床工作流的类别 1 至 2,被评为“错误”的输出主要落入需要覆盖或从显示中移除的类别 4 至 5。 这把类别分级与独立正确性参照联系起来,说明分级不仅是一致,而且与输出是否可用相关。 以每例的独立正确性评级作为参照,与读者赋予的 AI-RADS 类别进行比对。
AI-RADS 在 7 个代表性 AI 应用(涵盖图像类与生成式任务)上展示了适用性。 评估覆盖多种任务类型,而非单一应用或单一任务。 350 例病例来自 7 个代表性 AI 应用,由 5 名委员会认证放射科医师评估。
启示与展望
该框架面向放射科中 AI 输出的病例层面评估,适用于图像类与生成式 AI 任务,其设计目标是让读者对输出可靠性、临床实用性与建议处置给出一致判断,并让被覆盖的输出可在报告中留痕。原文显示其在 7 个代表性 AI 应用与 350 例病例上可操作,因此下一步可用于机构内 AI 输出的常规记录、读者培训与跨应用比较;受益者包括出具报告的放射科医师、负责 AI 治理与质控的团队,以及在报告中接收 AI 信息的临床医师。
原文为摘要式全文,未提供 5 个类别的具体定义、修饰符清单、各应用的名称与任务细节,也未给出各类别的病例分布或正确性参照的判定方式,因此读者若想直接套用框架,仍需查阅完整方法学。此外,读者间一致性是在 5 名委员会认证放射科医师、单一回顾性数据集与 7 个应用上测得的,其他读者群体、机构与更新一代 AI 应用下的一致性表现仍是待观察的问题;类别 1 至 2 与正确性“吻合良好”、类别 4 至 5 与“错误”的对应为方向性描述,原文未给出逐类别的具体数值。
