跳到主要内容
返回时间线
arXiv来源发表:

REViT-v2 用窗口化群卷积自注意力把旋转反射等变 ViT 的注意力代价从二次降为线性,并在 ImageNet-1K 上超过旋转翻转增强的 ViT-S 与 RE-ResNet

核心概要

作者提出 REViT-v2:把群卷积自注意力限制在局部窗口内(wG-CSA),并用群卷积分词与下采样构建多阶段等变特征金字塔,使旋转反射等变注意力的空间复杂度由图像面积的二次降为线性;在 ImageNet-1K 上,等变 REViT-v2-S 取得 79.27% 与 80.9% 的 Top-1 准确率,高于旋转翻转增强的 ViT-S(72.08%)和 RE-ResNet(77.37%),并在 Rotated MNIST 上以更小的模型、FLOPs、延迟与峰值显存保持约 98.26% 的准确率。

AI-generated editorial illustration: REViT-v2: Hierarchical Windowed Roto-reflection Equivariant ViT for Equivariant Feature Extraction

深度剖析

提出窗口化群卷积自注意力(wG-CSA),在非重叠局部窗口内计算注意力,同时在每个注意力头中保留完整的群表示场,且不引入绝对位置编码,空间结构由等变卷积 stem 与卷积式 Q/K/V 投影保留。 此前的 G-CSA 在全局评估时空间注意力矩阵对输入尺寸仍是二次的,而等变模型因正则群表示通常为每个特征场分配多个朝向通道,这一代价尤为突出;wG-CSA 把该代价改为对图像面积线性。 论文给出复杂度推导:全局注意力约为 O(n²),窗口大小为 w 时共 n/w² 个窗口、每窗口 w⁴ 次成对比较,总复杂度对固定 w 随图像面积线性;附录 A.1 在群表示正交、且变换把完整窗口映射为完整窗口(方形窗口、特征图边长可被窗口大小整除时成立)的条件下给出等变性证明。

构建多阶段等变特征金字塔:输入图像先被视为平凡表示场,由群等变卷积 stem 提升为正则群表示,两次带步长群等变卷积把分辨率降为四分之一;前三阶段之后用带步长群卷积降采样并增加表示场数量。 把高效 ViT 中已验证的层次化与多尺度思路(如 Swin 的局部窗口与金字塔、CvT 的卷积式分词与投影、MViT 的逐步降分辨率增通道)移植到群等变注意力框架中,使深层阶段在固定窗口下对应原图更大区域,从而无需构造全局高分辨率注意力矩阵即可建模高层交互。 论文以设计说明与复杂度论证支撑,并在 Rotated MNIST 上设置“Global w/downsampling”对照,以区分早期降采样与窗口化注意力各自的贡献。

在 ImageNet-1K 分类上,等变 REViT-v2 优于两个基线:REViT-v2-S 达到 79.27%/94.45%(18 M 参数)与 80.9%/95.1%(47 M 参数),高于旋转翻转增强的 ViT-S(72.08%/89.54%,22 M)与 RE-ResNet(77.37%/93.74%,11 M);REViT-v2-T 以 5 M 参数取得 72.58%/90.88%。 此前等变注意力方法难以扩展到低分辨率以上图像,而该工作展示了等变 ViT 可扩展到百万级参数与 ImageNet 规模图像。 结果来自 ImageNet-1K 分类实验;训练使用四张 RTX 4090、每卡批大小 128(有效批 512)、300 轮 AdamW、初始学习率 3e-4、权重衰减 0.05、20 轮线性预热后余弦衰减,窗口大小 7。

在 Rotated MNIST(200 轮、批大小 128)上,窗口化注意力把前向 FLOPs 从 1.69 GFLOPs 降至 80.1 MFLOPs、延迟相对全局为 0.61、峰值训练显存从 429.7 MB 降至 26.47 MB,准确率保持可比(98.26% 对 98.23%)。 该对照同时给出“Global w/downsampling”中间条件(333.6 MFLOPs、延迟 0.75、显存 50.98 MB、准确率 98.28%),用于区分早期降采样与窗口化注意力各自带来的效率收益。 效率与准确率数字来自同一 Rotated MNIST 训练设置下的对照表;参数规模相近(97.7 K、97.7 K、102.9 K)。

启示与展望

该工作面向大规模图像识别,把等变 ViT 用作骨干特征提取器;论文称在合适接口下也可用于密集预测任务,但正文只报告了 ImageNet-1K 分类与 Rotated MNIST 上的复杂度对照。等变性证明适用于群表示正交、且变换把完整窗口映射为完整窗口的情形,论文指出方形窗口在旋转与轴对齐反射下、且方形特征图边长可被窗口大小整除时满足该条件。效率收益的量化对照在 Rotated MNIST 上进行,ImageNet 规模上的效率数字未在正文给出。代码与预训练权重公开于 https://github.com/kc-ml2/revit,便于复现与后续研究。

等变误差分析在随机初始化、未加载训练检查点的情况下进行,因此反映的是架构设计诱导的等变性,而非优化后学到的性质;论文对 D4 群指出误差自提升层起累积,并将其归因于 45° 等角度旋转带来的插值伪影,这一解释属于作者归因。等变误差在 1024 张 ImageNet 验证集图像上测量,使用 resize 256、中心裁剪与 ImageNet 均值方差归一化。窗口化注意力的效率数字来自 Rotated MNIST 的小规模对照,其在 ImageNet 规模与更大模型上的表现仍需读者结合自身设置判断。

来源