608篇AI乳腺癌影像研究的文献计量分析显示:诊断占71.22%,可解释AI爆发值1.00成为最热前沿
核心概要
该研究以Scopus与Web of Science为数据源,经PRISMA流程从4831条记录中筛出608篇2020—2026年同行评审期刊论文与综述,用Bibliometrix与VOSviewer做任务感知、方法学中心的文献计量与主题分析,发现诊断类研究占71.22%、乳腺X线摄影占42.11%、可解释AI爆发值1.00为最强新兴热点,而治疗反应预测仅占2.30%、仅约15—25%的研究明确报告超参数调优策略。
FIGURE 1 PRISMA workflow diagram.
· 第 5 页深度剖析
按临床任务拆分图谱:诊断433篇(71.22%,篇均被引24.74)、预后167篇(27.47%,篇均20.50)、治疗反应14篇(2.30%,篇均3.25)、预后加治疗多任务6篇(0.99%)。 以往文献计量多把该领域当作单一整体,本研究首次把诊断、预后、治疗反应预测分开统计,并给出各自的篇均被引。 基于608篇最终纳入文献的计数与百分比,数据来自Scopus与Web of Science,经PRISMA四阶段筛选(4831条记录、去重2744条、题摘筛选后余1259篇、全文评估后纳入608篇)。
模态与数据集高度集中:乳腺X线摄影出现在256项研究(42.11%),约为超声(100项,16.45%)的2.5倍,组织病理87篇(14.31%),MRI仅21篇(3.45%);168次数据集提及中MIAS与BreakHis各37次(22.02%),INbreast 33次(19.64%),CBIS-DDSM 32次(19.05%),BUSI 29次(17.26%),乳腺X线数据集合计约占60.7%。 把模态分布与数据集使用频次并列呈现,使“乳腺X线摄影主导、基因组与人群级数据未被充分利用”这一结构性特征可量化。 来自608篇语料的模态计数与168次显式数据集提及的频次统计,并附数据集来源、样本量级、分析软件与访问地址表。
方法学实践报告不足:可解释AI中通用可解释性方法占31.91%(33篇)、Grad-CAM 14.64%(19篇)、CAM 11.84%(12篇)、显著性图5.92%(8篇)、SHAP 3.95%(7篇)、LIME 2.96%(3篇)、注意力可视化1.97%(3篇)、Integrated Gradients 0.99%(1篇);超参数优化中最常用策略为遗传算法1.97%(12篇)、粒子群1.32%(8篇)、贝叶斯优化0.33%(2篇)、网格搜索0.16%(1篇),仅约15—25%的研究明确描述调优方法。 以往文献计量很少专门评估可解释AI采纳度与超参数优化报告情况,本研究把这两项作为独立维度量化。 基于608篇参考文献的显式提及计数与百分比,作者同时说明这些统计依赖标题、摘要与关键词提取,存在报告偏倚。
热点迁移与性能梯度:可解释AI爆发值1.00、多模态约0.92、注意力0.94、Transformer与ViT约0.89,而深度学习0.73、CNN 0.76被归为成熟或稳定核心;诊断模型典型准确率90—99%、AUC 0.85—0.99,预后C-index 0.65—0.90,治疗反应AUC 0.65—0.85且pCR预测不一致。 用爆发比而非单纯词频刻画趋势,把“从精度导向转向可解释、多模态、临床稳健”的范式转变量化,并给出跨任务性能梯度。 关键词频次与2023—2026近期占比计算出的爆发比,以及语料中报告的性能区间汇总;作者提示这些高准确率多来自回顾性、单中心或公开数据集,缺少独立外部验证。
启示与展望
该分析面向2020—2026年Scopus与Web of Science收录的同行评审英文期刊论文与综述,聚焦乳腺X线摄影、超声、MRI、组织病理等影像模态,因此其结论适用于影像驱动的乳腺癌AI研究布局、数据集与工具选型、以及报告规范制定。对希望了解领域任务分布、模态集中度、可解释AI与超参数优化实践现状的研究者、临床团队与工具开发者,本文提供了可直接引用的计数与表格化资源清单。作者提出的临床转化路径把工作分为内部验证、前瞻性与外部评估、临床验证与影响评估三阶段,并列出数据质量、可复现性、透明度、可解释性、公平性、隐私、监管合规与部署后监测等贯穿性要求,可作为后续研究设计与评估框架的参照。
本次读取的文本为不完整版本,图1至图16的具体内容未包含在内,因此PRISMA流程图、关键词共现网络、年度产出与引用增长曲线、期刊与作者产出分布、爆发图以及转化路径示意图只能依据正文描述理解,无法核对图中细节。作者亦指出若干范围性限制:语料仅来自选定数据库的已发表索引文献,可能遗漏其他仓储、预印本与非英文成果;定量提取依赖标题、摘要与关键词,数据集、框架与调优策略未必被一致记录;文献计量无法判断模型是否经过真实临床环境验证;多数研究依赖CBIS-DDSM、MIAS、INbreast等少数基准数据集,患者人群与成像条件代表性有限;引用与关键词趋势反映研究活跃度,不等同于科学质量或临床影响。此外,筛选由单一评审者完成且未预注册,可解释AI与超参数优化的统计基于显式提及,可能低估实际使用情况。读者可继续关注:Transformer类模型的多中心外部验证进展、可解释性评估标准的建立、多模态与联邦学习的数据协调方案,以及治疗反应预测这一占比仅2.30%的方向能否形成可比较的基准。
