PixelDense 把 SAM2、Depth Anything v2 与 Metric3D v2 拆成语义与几何两条对齐流,让 PixelGen-XXL 的 GenEval Overall 从 0.7927 升到 0.8093
核心概要
该工作提出 PixelDense,把 DINOv2 与 SAM2 送入语义投影流、把 Depth Anything v2 与 Metric3D v2 送入几何投影流,并用权重空间正交惩罚让两流占据不相交子空间,在 PixelGen 与 DeCo 上以同一配方提升 GenEval、DPG-Bench 与 HPS v2.1,其中 PixelGen-XXL 的 GenEval Overall 由 0.7927 升至 0.8093,并优于所有单教师与未分解多教师变体。
深度剖析
论文把稠密预测基础模型当作 REPA 对齐目标,发现 SAM2、Depth Anything v2、Metric3D v2 各自都能在像素空间扩散中超过仅用 DINOv2 的 GenEval 基线,且两个几何教师领先于分割教师。 此前 REPA 类对齐几乎只用 DINOv2、CLIP 等语义编码器,而 iREPA 指出对齐效应来自空间结构;该工作顺着这一线索,首次系统地把显式预测空间结构的稠密预测模型用作对齐教师。 在 PixelGen 文本到图像骨干上微调,单教师结果列于表 4:SAM2 为 0.8020、DA2 为 0.8069、M3D 为 0.8060,均高于 DINOv2-only 基线 0.7927。
论文识别出稠密多教师对齐中的负迁移:四个教师等权求和反而低于最好的单个几何教师,原因是语义与几何梯度共享同一个去噪器投影而相互竞争。 这把教师组合从“加更多教师”重新表述为表示路由问题,指出语义编码器奖励视角不变性与实例身份、几何编码器奖励度量布局与表面朝向,二者不变性不相容。 表 4 中未分解求和为 0.8036(等权)、0.7970(L2 归一化)、0.8009(降权),均低于最佳单教师 DA2 的 0.8069;附录 C.2 的训练动力学诊断显示朴素求和的跨教师步长增量余弦更高、语义与几何的损失下降差距更大。
PixelDense 用语义流与几何流加权重空间正交惩罚实现分解,完整模型达到 0.8093,优于所有单教师与未分解变体,且任一单流单独使用都更低。 相对未分解求和,分解让每个教师信号被更均匀地吸收:平均相对损失下降从 72.13% 升到 73.40%,语义与几何下降差距从 0.0719 降到 0.0006,跨教师变异系数从 0.0973 降到 0.0629。 表 4 中语义流(DINOv2+SAM2)为 0.8022、几何流(DA2+M3D)为 0.7960、完整 PixelDense 为 0.8093;留一法显示去掉任一教师都会下降(去 DINOv2 为 0.7940、去 SAM2 为 0.8027、去 DA2 为 0.8025、去 M3D 为 0.8037)。
结构保持能力在独立探针与编辑任务上同步体现:部分噪声重建中全景 PQ 最高提升 53.1%、深度 AbsRel 最高降低 36.0%(τ=0.5),SDEdit 编辑中背景 PSNR 最高提升 2.2 dB。 文本到图像指标对是否保留特定输入场景的几何不敏感,该工作用与 REPA 教师无关的 OneFormer 与 Marigold 探针,以及 PIE-Bench 编辑掩码外的背景指标,补充了结构层面的证据。 表 2 在 COCO 与 Flickr30K 的每个数据集、参考类型、探针与噪声水平上均优于匹配的 PixelGen 基线,τ=0.5 时差距最大、τ=0.9 时收窄;表 6 中 SDEdit 在全部七个噪声水平、六项指标上均更好。
启示与展望
该结果面向像素空间扩散变压器,其去噪器 token 位于稠密教师所消费的同一 RGB 图块网格上,因此每个 token 可直接对齐到对应位置的教师特征;论文在 PixelGen-XXL 与 DeCo 上以同一配方实例化,说明配方可跨像素空间骨干迁移。对齐只在去噪器的单个中间块上进行,四个教师(DINOv2-B/14、SAM2 Hiera-L、Depth Anything v2 ViT-L、Metric3D v2 ViT-L)在训练中冻结、推理时丢弃,部署采样器只读三通道 RGB,因此采样成本与下游过滤流程不变。编辑侧的证据限于 SDEdit 在 PIE-Bench 上的设置,作者把基于反演与基于指令的编辑方法留作后续工作。
正文以表格与附录形式给出大量数字,但首页证据包中的表格在若干处出现数值缺失(例如摘要与引言中部分百分比、dB 与加速倍数在抓取文本里为空),因此这些具体幅度只能依据表 1、表 2、表 4、表 5、表 6 与附录表格中可读到的数值来复述。对齐目前只在单一中间块进行,多尺度与多块对齐、骨干与训练语料规模扩展、以及四教师之外的教师库仍是开放方向;编辑侧只覆盖 SDEdit,反演式与指令式编辑以及编辑后的身份与三维几何指标尚未评估。教师为自然图像上训练的感知模型,因此会继承其训练分布中的偏差,叠加在像素骨干自身的偏差之上。
