跳到主要内容
返回时间线
arXiv来源发表:

VisionHOPE 把视觉骨干变成自修改学习系统,在 ImageNet-1K、COCO、ADE20K 上取得有竞争力的结果

核心概要

该工作提出 VisionHOPE,把视觉骨干表述为自修改学习系统:内容、键、值、学习率与保留五类记忆在每次扫描中共同演化,并配合稳定性匹配的步长控制(自指注入软上限加保留转移谱夹紧)证明记忆动态非扩张,在 ImageNet-1K、COCO 与 ADE20K 上取得有竞争力的结果。

AI-generated editorial illustration: VisionHOPE: Visual Backbones as Self-Modifying Learning Systems

深度剖析

提出 VisionHOPE,将视觉骨干表述为自修改学习系统,五类记忆(内容、键、值、学习率、保留)沿视觉扫描共同演化,使模型不仅改变记住什么,也改变如何学习。 论文把这一构造与 TTT 类视觉骨干区分开:后者在图像内适应一个内部学习器,但其表示映射与更新规则仍主要由外部参数决定;VisionHOPE 依据 Nested Learning 的自指构造让存储内容与学习规则共同演化。 论文以方法构造与消融支持该主张:在 P-VisionHOPE-S 上,去掉自适应 K/V 与自适应动态分别降至 81.9 与 82.0,去掉 DGD 降至 81.9,完整模型为 82.3。

识别出无约束自指更新在视觉中的稳定性障碍,并推导稳定性匹配的步长控制,结合自指注入软上限与保留记忆转移的谱夹紧,证明沿每次扫描的记忆动态非扩张。 论文给出命题与推论层面的证明:互补算子界限制保留转移的谱范数并让可允许的自指注入随收缩余量缩放,从而得到逐 token 与分块递推的非扩张性。 消融显示去掉软注入上限会导致前向传播在训练早期数值发散(NaN),而注入硬夹紧与软谱上限虽保持稳定但精度低于完整方案(81.8、81.9 对 82.3);谱夹紧在完整模型中仅约 1% 的 token 更新上激活。

把 Nested Learning 的分块公式适配到四个方向扫描,使分块与图像行、列对齐,从而在二维特征图上以线性于 token 数的代价处理视觉输入。 行主序的正反扫描使用按行对齐的分块,列主序的正反扫描使用按列对齐的分块,各方向维护独立状态并按通道融合输出;分块公式让 token 相关量可在块内并行计算。 效率分析给出 DeiT 的二次交互与内存项,而 Vim 与 VisionHOPE 保持线性;实测中 P-VisionHOPE-B 随分辨率保持线性增长,在相近 FLOPs 下比 Vim-B 吞吐更高、内存更低。消融显示方向覆盖增加带来提升(单向 81.6、双向 81.9、四向固定求和 82.1、完整 82.3)。

在 ImageNet-1K 分类、COCO 检测与实例分割、ADE20K 语义分割上,VisionHOPE 在评测的各个尺度取得最佳或并列最佳结果。 论文在分层与平铺两类骨干布局中与 CNN、ViT、SSM、TTT 多类基线比较,并在三个任务上报告结果,说明自修改学习可作为通用视觉骨干的实用基础。 ImageNet-1K 上 VisionHOPE-T/S/B 分别为 84.1、85.2、85.6,平铺 P-VisionHOPE-T/S/B 为 78.4、82.3、83.4;COCO 上 VisionHOPE-T/S/B 的框 AP 为 47.9、49.5、50.5;ADE20K 上 mIoU 为 49.4、50.3、51.8。

启示与展望

该结果面向通用视觉识别:分类、检测与实例分割、语义分割,适用于分层与平铺两类骨干布局,并可在分辨率提高时保持线性计算与内存增长。论文指出当前评估集中在通用视觉识别,尚未把 VisionHOPE 作为多模态大语言模型的视觉编码器进行评估,医学影像与遥感等专门下游任务的有效性也仍待实证检验,作者表示计划扩展到这些设置。对读者而言,这意味着该方法目前最适合作为通用视觉骨干的替代方案来试用,而不是直接假定其在专门领域或多模态理解中同样有效。

仍可关注的问题包括:谱夹紧在完整模型中仅约 1% 的 token 更新上激活,去掉它在当前设置下精度不变,因此其在不同数据规模或更高分辨率下的作用仍需更多观察;软注入上限一旦移除即出现数值发散,说明稳定性控制与训练配置的耦合程度值得进一步刻画;论文未报告多模态大语言模型编码器、医学影像与遥感等专门任务的实证结果,这些方向的有效性仍是开放问题;此外,消融主要在 P-VisionHOPE-S 上进行,其他尺度与骨干布局下的设计选择敏感性尚待补充。

来源