跳到主要内容
返回时间线
arXiv来源发表:

纹理驱动视觉学习存在低频捷径:剪除低频分量使分布内准确率最高提升10%、分布外准确率最高提升40%

相关研究与后续进展

核心概要

该工作针对纹理驱动视觉域开展捷径学习分析并与形状驱动的标准基准对比,发现纹理驱动域主要依赖少数频谱偏斜的低频分量(LFC)做决策,而高频分量(HFC)其实具有更高预测力;从训练集和测试集中剪除LFC可缓解该捷径并带来更均衡的频谱行为,在算法与真实域偏移下使分布内准确率最高提升10%、分布外准确率最高提升40%,同时通用与领域专用基础模型也可能存在低频捷径。

Source-provided article image: Low-Frequency Shortcuts in Texture-Driven Visual Learning
Figure 1 ·

Figure 1 : Spectral behavior of models trained on texture-driven domains show that models make majority of their decisions based on a few low-frequency components (first three figures above, from left). Once we prune low-frequency components (LFCs) from training and test sets, spectral behavior shifts towards higher-frequencies (forth figure above), and we obtain a significantly higher ID accuracy, up to 10% (Section 5 ). These results show that texture-driven domains suffer from low-frequency shortcuts, where models learn from LFCs despite that higher-frequency components have a higher predictive power. We show that low-frequency shortcuts persist across different model sizes, architectures, and hyperparameters (Section 5 ), under various OOD conditions (Section 6 & 7 ), for pretrained foundation models (Section 8 ), and different resolutions, transformation block sizes, and color spaces (Section 9 ).

arXiv

深度剖析

纹理驱动域存在低频捷径:模型多数决策基于少数频谱行为偏斜的低频分量,尽管高频分量具有更高预测力。 既有捷径学习研究都基于少数形状驱动的标准基准,本文把分析扩展到纹理驱动域并与标准基准对比,指出该域特有的低频捷径现象。 基于对纹理驱动域与标准基准的对比分析,通过频谱行为刻画与预测力比较得出;摘要未给出具体数据集名称与样本量。

从训练集和测试集中剪除低频分量可缓解捷径,使频谱行为更均衡,在算法与真实域偏移下分布内准确率最高提升10%、分布外准确率最高提升40%。 提出以剪除LFC作为缓解手段,并同时报告ID与OOD两类准确率提升,覆盖算法域偏移与真实世界域偏移两种设定。 以剪除LFC前后的准确率对比为证据,提升幅度以“up to”形式给出,属于该实验设定下的观测结果。

通用与领域专用基础模型同样可能遭受低频捷径;大模型虽可缓解捷径,但计算成本高,且准确率可能显著低于经捷径剪除、从头训练的小模型。 把低频捷径的诊断从常规训练模型扩展到基础模型,并给出大模型与剪枝小模型在成本与准确率上的对比视角。 基于对通用与领域专用基础模型的观察,以及大模型与捷径剪除小模型的比较;摘要未给出具体模型名称与数值。

降低图像分辨率会放大捷径程度;较大的频率变换块尺寸比小尺寸更能捕捉低频捷径;低频捷径在不同颜色空间中持续存在。 给出影响低频捷径程度的三个条件性观察(分辨率、频率变换块尺寸、颜色空间),为实践者在新领域诊断与设计提供可操作线索。 来自对分辨率、块尺寸与颜色空间的条件对比实验;摘要未报告具体数值与统计检验。

启示与展望

该工作面向纹理驱动的视觉学习域,适用于需要在新兴、欠研究领域构建或评估模型的实践者,尤其是关注分布外泛化与域偏移的场景。其缓解手段(从训练与测试集中剪除低频分量)可直接嵌入现有训练与评测流程,并可与从头训练的小模型结合使用;对基础模型使用者而言,该分析提示在成本受限时剪枝小模型可能是有竞争力的选择。结论的适用范围以纹理驱动域为设定,与形状驱动标准基准的对比用于说明差异而非替代后者。

摘要以“up to”形式报告准确率提升,未给出具体数据集、样本量、模型架构与统计检验细节,因此提升幅度的稳定性与适用边界仍需结合正文实验设定判断。低频捷径在不同颜色空间中持续存在这一观察,其具体颜色空间与变换方式在摘要中未展开。大模型与捷径剪除小模型之间的准确率与成本比较,摘要未给出具体模型与数值,读者若关心该权衡需查阅正文。此外,剪除LFC在测试集上的操作是否适用于无法预先获知测试分布的在线场景,摘要未作说明,属于可进一步关注的问题。

来源