让稀疏系数自己学会压缩:信息瓶颈视角下的训练自适应卷积稀疏编码
核心概要
该工作把卷积稀疏编码中的稀疏系数从人工设定的固定超参数改为可微、可与网络参数联合学习的变量,用FISTA展开迭代实现其梯度回传,并在信息瓶颈框架下解释该系数对“压缩—保留”权衡的控制作用,在CIFAR-10/100与ImageNet-1K上取得有竞争力的干净数据识别精度,并在多种输入扰动下显著提升鲁棒性,同时提出一种仅用少量无标签受损样本、冻结主干参数、只调整压缩强度的后训练自适应策略。
深度剖析
提出训练自适应卷积稀疏编码(TA-CSC),将稀疏系数作为可微变量嵌入FISTA展开迭代,与卷积字典和网络参数联合优化。 此前的CSC类方法(如ML-CSC、SCN、SDNet等)通常把稀疏系数当作预先选定的超参数,本文改为由表示与下游任务共同决定的可学习量,并给出对展开迭代的完整递归求导路径。 论文给出式(11)-(14)的逐迭代梯度推导,并以非负参数化保证系数有效;实验在ResNet-18上构造TA-CSC-18与TA-CSC-18all两种替换方案,使用2次FISTA展开迭代,压缩激励权重设为0.001。
从信息瓶颈角度建立CSC与IB目标的对应关系,把稀疏项视为压缩、重建项与任务损失视为任务相关信息保留,二者竞争实现压缩—保留权衡。 以往CSC多被当作信号处理或可微优化层使用,本文明确把稀疏系数解释为IB中的压缩控制变量,并据此设计训练目标式(15)-(16)。 该对应关系以公式层面的类比与训练动力学可视化支持:训练早期系数较小、任务拟合为主,精度接近饱和后系数快速上升并收敛,呈现“拟合—压缩”两阶段;层级上浅层系数较小、接近预测目标的层系数较大。
提出无标签后训练自适应策略:冻结主干网络参数,仅用少量受损或分布偏移的无标签样本调整压缩系数,以相对重建误差作为保真度度量。 与在干净数据上一次性学定压缩强度不同,该方法在输入分布受损时重新估计压缩强度,且不需要标签,也不同于对固定稀疏编码模型做逐样本调参。 默认使用100个无标签受损样本;在CIFAR-10-C与ImageNet-C的高斯、散斑、脉冲等噪声下,TA-CSC-18加后训练自适应超过SDNet-18的逐样本调参结果,例如CIFAR-10-C高斯噪声下为66.63%对64.92%。
在干净数据识别与受损数据鲁棒性上同时取得有竞争力的表现,并观察到压缩系数随噪声强度单调增大。 在相同训练协议下,TA-CSC-18all在CIFAR-10、CIFAR-100、ImageNet-1K上分别达到97.65%、80.76%、72.53%,高于ResNet-18及SCN、SDNet等CSC基线;鲁棒性方面无需后训练自适应的TA-CSC-18已稳定优于基线。 结果来自CIFAR-10/100与ImageNet-1K的分类实验及CIFAR-10-C、ImageNet-C的多种噪声设置;消融显示FISTA迭代数从2增至8、自适应样本从50增至500均有提升但增益相对有限,故默认取2次迭代与100个样本。
启示与展望
该结果面向以ResNet为骨干的图像分类任务,在CIFAR-10/100与ImageNet-1K及其受损版本上验证;方法以FISTA展开层替换卷积层,后训练自适应适用于输入分布受损或偏移、且能获得少量无标签样本的场景。对希望在不重训主干的前提下提升受损数据鲁棒性的使用者,以及关注表示压缩可控性的研究者,这一框架提供了可直接借鉴的接口。
论文自述当前主要在ResNet架构与分类任务上评估,学习到的系数与信息压缩之间的关系主要依赖经验证据,稀疏编码与信息瓶颈目标之间更严格的理论联系仍待建立。此外,首页证据包为全文解析,但图表以文字与表格形式呈现,图2、图3的具体曲线形态只能依据正文描述理解;不同骨干、更多视觉任务与更广泛分布偏移下的表现,以及压缩系数在训练中的四峰模式是否普遍存在,仍是值得继续观察的问题。
