视觉模型规模扩大并不稳定提升基于定位的解释质量
核心概要
该研究在Oxford-IIIT Pet与Chest X-ray Pneumothorax两个带真值分割掩膜的数据集上,对ResNet、DenseNet与Vision Transformer家族的11个视觉模型(7个从头训练、4个使用预训练权重)用五种事后解释方法(Saliency、GradientSHAP、Integrated Gradients、Feature Permutation、Grad-CAM)生成归因图,并用Relevance Rank Accuracy与作者提出的Dual-Polarity Precision两项定位指标衡量归因与掩膜的对齐程度,结果显示在多数统计比较中增加深度与参数量并未提升解释
Fig. 1
PubMed深度剖析
在60项模型规模比较中,仅3项(5%)由家族内最大模型取得最高分,18项(30%)中较小模型持平或超过最大模型,39项(65%)在Benjamini-Hochberg校正后未能拒绝解释质量相等的原假设,且效应量多为可忽略到小。 此前关于规模与解释保真度的关系多为假设或零散观察,该研究以11个模型、5种解释方法、2个数据集和3个随机种子的系统比较给出量化证据。 基于每种子200张测试图像、三种子共600张图像的归因结果,使用Kruskal-Wallis与Mann-Whitney U检验并做Benjamini-Hochberg校正,同时报告Cliff's δ与η²效应量。
提出Dual-Polarity Precision(DPP),将归因图分为正负两部分,分别计算正归因落在掩膜内的精度与负归因落在掩膜外的精度并取宏平均,从而对背景中的正归因和感兴趣区域内的负归因同时施加惩罚。 既有基于质量的评估常通过平方或整流把带符号归因映射为非负值,从而丢失符号信息,使负归因仅以幅度而非反证形式参与评估。 给出TPA、FPA、TNA、FNA与P_pos、P_neg的显式公式,并说明带符号归因的随机基线为0.5、仅正归因方法基线为0且上限为0.5。
在40项预训练比较中,16项(40%)在校正后显著,其中仅5项(12.5%)预训练模型得分更高,11项(27.5%)从头训练模型持平或更优,24项(60%)未拒绝原假设;同时预训练ResNet-50在逐层权重随机化下退化更大,Saliency的像素置换敏感度从0.003升至0.082。 把预训练的影响从预测性能扩展到解释的定位质量与对学习参数的依赖程度,指出预训练更多改变解释与权重的关联而非稳定提升定位分数。 统计检验基于每种子200张图像、三种子共600张图像;健全性检验在Oxford-IIIT Pet上每种子32张图像,使用逐层随机化与像素置换两种扰动并报告Cliff's δ。
在Chest X Pneumothorax数据集上,各模型与各解释方法的RRA接近零、DPP接近0.5基线,而分类AUC在0.77至0.87之间,提示预测性能与解释质量可能分离。 以带真值掩膜的定位指标直接展示高分类性能与近零定位对齐可以并存,补充了仅凭准确率评估模型时的盲区。 该数据集掩膜平均仅覆盖图像面积的1.4%,而Oxford-IIIT Pet为29.7%,作者据此说明小掩膜使评估对微小定位误差更敏感。
启示与展望
该研究为二分类设定下的图像定位评估,适用于具备专家分割掩膜、需要审查归因是否落在感兴趣区域的自然图像与医学影像场景,为模型选择与审计提供RRA与DPP两项可量化指标;作者指出后续可扩展到多分类、概念级解释方法(如TCAV)、原型式可解释架构(如ProtoPNet),以及在受控分布偏移与对抗扰动下检验RRA与DPP与可靠性的关系,并建议使用LIDC-IDRI等多标注者数据集以软掩膜进行概率化评估。
掩膜重叠被当作解释质量的代理,当临床相关线索位于标注区域之外时该代理可能不完整;热图类指标不覆盖概念级或对象级解释;三个种子仅提供最小的种子间变异估计;功效估计在α=0.05而非Benjamini-Hochberg校正阈值下计算,作者称其略偏乐观并仅作参考;CheXpert预训练的DenseNet-121在Oxford-IIIT Pet上三个种子均未在100轮预算内收敛,相关比较被作者标注为仅供完整性参考;灰度输入可能影响颜色携带信号的非医学领域;此外,RRA与DPP是否与专家决策支持相关,仍需放射科医师参与的研究来补充。
