AGGRNet用可学习阈值把医学图像特征分为信息性与非信息性两类,在Kvasir上比HiFuse-Small准确率高5.48%
核心概要
该工作提出AGGRNet框架,在YOLOv11分类骨干中嵌入特征提取与聚合(FEA)模块和C2PCA块,通过空间与通道注意力加可学习阈值τ把特征图分为信息性与非信息性两部分,再用交叉注意力聚合,在LIMUC、ISIC2018、Kvasir、PathMNIST、RetinaMNIST五个公开数据集上取得优于所比较SOTA模型的结果,其中Kvasir准确率提升5.48%、LIMUC准确率提升2.2%。
Figure 1. Comparison of proposed AGGRNet framework with
· 第 1 页深度剖析
提出FEA模块,用空间注意力与通道注意力相加后经sigmoid得到注意力分数S,再用可学习阈值τ(初始0.5)生成互补二值掩码Winfo与Wninfo,把特征图分为信息性与非信息性两部分。 与对所有空间区域和通道一视同仁的标准特征提取不同,该设计显式地把诊断相关区域与背景分离,并让阈值在训练中自适应调整。 方法在正文给出完整公式(式1至式7)与τ初始值0.5的设定;消融显示逐级加入FEA模块后准确率从0.791升至0.793再升至0.807。
提出FAM交叉注意力,令Q=Xinfo+Xninfo、K=Xinfo−Xninfo、V=Xinfo,使注意力权重偏向信息性特征。 作者给出QKT展开为‖Xinfo‖²−‖Xninfo‖²加交叉项,说明正偏置项提升信息区域、负偏置项抑制非信息区域,形成对比式交叉注意力。 数学推导在式11中给出;聚合结果经式12、式13的softmax注意力计算,并通过式14的残差连接保留原始特征。
用C2PCA块替换YOLOv11分类骨干中的C2PSA自注意力块,改为通道注意力。 作者的理由是FEA已处理空间与跨特征注意力,C2PCA可专注通道优先级,且通道注意力在末层计算上更高效,并更贴合医学图像中不同通道编码不同解剖或病理模式的特点。 消融显示替换后准确率由0.775升至0.793,即+2%;C2PCA的通道扩展、分支拆分、通道注意力、两次残差与拼接步骤在算法1中给出。
在五个公开数据集上报告优于所比较SOTA模型的结果:Kvasir准确率0.916对HiFuse-Small的0.8612(+5.48%),LIMUC准确率0.810对CDW-CE(Inception-v3)的0.788(+2.2%),ISIC2018准确率0.871对HiFuse-Base的0.8585(+1.25%),PathMNIST准确率0.926对ResNet-50(28)的0.911(+1.5%),RetinaMNIST准确率0.537对Google AutoML Vision的0.531(+0.6%)。 同一框架同时覆盖疾病亚型分类与严重度分级两类任务,而所比较的CDW-CE与SATOMIL等方法分别局限于序数损失或患者级多示例学习设定。 结果以表格形式给出准确率、Macro-F1、QWK、MAE、精确率、召回率与AUC;AGGRNet参数量38.65M,低于HiFuse-Base的127.80M;训练用ImageNet预训练权重、224×224输入、SGD(学习率0.01、动量0.937、权重衰减5×10⁻⁴)。
启示与展望
该工作面向疾病亚型分类与严重度分级两类医学图像任务,适用于内镜(LIMUC、Kvasir)、皮肤镜(ISIC2018)、组织病理(PathMNIST)与眼底(RetinaMNIST)等公开图像数据集上的单图分类设定;FEA被设计为架构无关、可插入CNN较深层并配残差连接,因此后续可尝试迁移到其他骨干或其他医学图像分类任务。对读者而言,这意味着它提供的是一个可复用的特征分离与聚合组件,以及一套在公开基准上可比的评测结果,而非已进入临床流程的诊断工具。
读者仍会关注:可学习阈值τ在训练中的收敛行为与最终取值未在正文报告;FEA插入位置的选择依据是作者对CNN特征层级的分析,不同骨干下的最优位置仍需探索;结果均为公开数据集上的离线评测,未涉及前瞻性临床验证或读者间一致性评估;正文提到补充材料含额外实验,但本次加载文本未包含该部分,因此补充实验的具体内容无法在此总结。
