DisParQ 用冻结 DINOv2 自监督学习离散部件概念,ImageNet 线性探测达 83.2% top-1
核心概要
DisParQ 提出一种无需类别标签和语言监督的方法,从冻结的纯视觉自监督骨干网络中学习空间定位的离散概念表示:每个图像块被分配给可学习原型字典中的唯一概念,每张图仅稀疏激活少量概念,并用连续残差量化出的离散属性刻画概念变化,空间解码器仅凭概念与属性重建骨干表示;在七个数据集上,其在 ImageNet 线性探测中达到 83.2% top-1,接近冻结的 DINOv2 教师,概念一致性高于语言对齐模型,细粒度识别保持竞争力,并支持跨类别部件检索。
深度剖析
DisParQ 从冻结的纯视觉自监督骨干中学习空间定位的离散概念表示,每个图像块被分配给可学习原型字典中的唯一概念,且每张图只允许稀疏子集的概念激活。 此前的概念模型常受限于固定类别,或依赖语言来定义概念;DisParQ 不需要类别标签,也不需要语言监督。 方法描述明确给出图像块到唯一概念的分配规则与稀疏激活约束,并说明概念来自可学习原型字典。
为刻画同一概念在不同图像中的变化(例如“轮子”的类型),DisParQ 在概念之外学习连续残差,并将其量化为离散属性。 把概念本身与概念的可变属性分开建模,使离散表示既能保持可解释的部件概念,又能表达同一部件在不同实例上的差异。 文本明确描述了连续残差的学习与量化过程,并给出“轮子”类型作为概念变化的示例。
空间解码器仅凭概念与属性重建骨干表示,重建成功即说明离散表示保留了骨干的信息。 以重建作为信息保留的检验方式,把“离散概念是否足够表达骨干特征”转化为可验证的目标。 文本将重建成功与信息保留直接关联,作为该表示有效性的方法学依据。
在七个数据集(ImageNet、PartImageNet、Places、CUB、Cars、Dogs、Flowers)上,DisParQ 在 ImageNet 线性探测中达到 83.2% top-1,接近冻结的 DINOv2 教师,概念一致性高于语言对齐模型,细粒度识别保持竞争力,并支持跨类别部件检索。 同时覆盖通用识别与细粒度基准,并在概念一致性上优于语言对齐模型,还展示了跨类别部件检索能力。 评估覆盖七个数据集,包含通用识别与细粒度基准;ImageNet 线性探测给出 83.2% top-1 的具体数值,并与冻结 DINOv2 教师比较。
启示与展望
该工作面向希望在不使用类别标签和语言监督的前提下获得可检查概念表示的视觉研究者与工程实践者,适用于以冻结纯视觉自监督骨干为基础、需要空间定位部件概念与跨类别部件检索的场景。其评估覆盖通用识别(ImageNet、PartImageNet、Places)与细粒度基准(CUB、Cars、Dogs、Flowers),因此结论主要适用于这些数据集所代表的识别与检索设定。
当前文本为摘要级信息,未给出概念字典规模、稀疏度设定、属性量化方式、解码器结构以及各数据集上的完整指标,因此无法判断这些设计选择对结果的影响。跨类别部件检索的具体协议与评价指标也未在文本中说明。读者可关注:离散概念数量与稀疏约束如何影响概念一致性与细粒度识别之间的平衡,以及重建目标在多大程度上保证概念表示保留骨干信息。
