跳到主要内容
返回时间线
arXiv来源发表:

去掉条件编码器残差连接并融合多层特征,DDT-RFE 在更少编码器块下同时提升四类视觉理解任务与 ImageNet 生成 FID

相关研究与后续进展

核心概要

作者在解耦扩散 Transformer(DDT)的条件编码器中移除 Self-Attention 与 MLP 周围的残差连接,改用零初始化输出门与混合正交注意力初始化保证训练稳定,并把输入 patch 嵌入与各编码器块输出聚合为编码器输出;在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 的设定下,DDT-RFE 在图像分类、语义分割、物体发现、语义对应四类视觉理解任务上整体优于 DDT,且编码器块数更少(L 尺度 12 对 20,XL 尺度 14 对 22),ImageNet 生成 FID 从 8.98 降至 7.68(L)和从 7.27 降至 6.81(XL)。

Source-provided article image: Should We Skip Diffusion?
Figure 1 ·

Figure 1: Left: Overall architectures of DDT and DDT-RFE (our method). Right: Encoder representations from shallow to deep layers at timestep t = 0.5 t=0.5 . Features are projected into three dimensions using PCA and visualized as RGB images. Our method produces more abstract representations with clean backgrounds and salient objects. More visualizations are shown in Figs. 5 , 6 and 7

arXiv

深度剖析

移除条件编码器内部残差连接、把多层特征聚合放到编码器输出端,可以在更浅的编码器上获得更好的语义表示。 DDT 通过残差连接让浅层特征持续累积到深层(论文式 8 的展开),作者改为每个块只做门控变换、无恒等通路,并在输出端聚合输入 patch 嵌入与所有块输出(式 11)。 在 ImageNet-1k、分辨率、80 epoch、batch 1024 下从零训练 L(458M)与 XL(675M)两档;分类线性探针 top-1 为 60.9(L)与 62.4(XL),高于 DDT-L 的 59.6 与 DDT-XL 的 61.8,且编码器块数由 20/22 降至 12/14。

残差无关编码器需要配套初始化才能稳定收敛,作者提出的混合正交注意力初始化比 mimetic 初始化少调超参数。 mimetic 初始化需调两个标量常数,作者改为把共享随机正交矩阵与默认 query/key 初始化按系数混合(式 13),并把 MLP 权重按 SUO 分布初始化以保持输入向量 RMS、条件数为 1。 消融显示去掉该初始化后 FID 由 7.68 升至 9.86,分类 top-1 由 60.9 降至 38.6,分割 mIoU 由 57.02 降至 30.62,对应 PCK@0.1 由 37.24 降至 13.89,作者将其归因于网络条件数问题导致的表示坍缩。

编码器输出端聚合多层特征对生成与理解都关键,且使编码器输出与最佳中间块的语义差距明显缩小。 DDT 的残差累积使单块已隐含多层信息,而 DDT-RFE 把抽象与多尺度上下文分离:抽象在层级内产生,多尺度由聚合恢复。 分类 top-1 从最佳块到编码器输出的下降,DDT-L 与 DDT-XL 分别为 7.8 与 4.7 个百分点,DDT-RFE-L 与 XL 仅 1.2 与 1.1 个百分点;多尺度探针在 ADE20K 上对 DDT-RFE 增益更大(L 尺度 +2.9 对 +1.8 mIoU),且多尺度下 DDT-RFE 在两个尺度、全部数据集上领先。

表示质量的提升与生成质量提升同时出现,而非此消彼长。 在相同训练预算下,DDT-RFE 在 L 与 XL 两档均取得所比较模型中的最低 FID,且与同深度 DDT-L(12en12de,FID 8.82)相比仍有优势。 每模型用 EMA 权重、250 步 Euler ODE 采样器、无 classifier-free guidance 生成 50,000 样本;XL 尺度 FID 6.81 对 7.27、sFID 5.50 对 5.89、precision 0.740 对 0.724,IS 相同(125.6),recall 略低(0.610 对 0.624)。

启示与展望

该结果面向在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 条件下从零训练 DDT 类模型的研究者与工程师,适用于希望用更浅条件编码器同时服务生成与下游视觉理解任务的场景。可直接复用的要素包括:编码器块内去除 Self-Attention 与 MLP 残差、输出门零初始化、混合正交注意力初始化与 SUO MLP 初始化,以及在编码器输出端聚合输入 patch 嵌入与各块输出。评估流程上,分类采用 DINO 式 kNN 与 BatchNorm+线性层 30 epoch 线性探针,物体发现用 LOST 报告 CorLoc,语义对应在 SPair-71k 上报告 PCK@0.1,分割用线性探针报告 mIoU,生成用 EMA 权重与 250 步 Euler ODE 采样 50,000 样本报告 FID/sFID/IS/precision/recall。

作者指出实验受算力限制,仅覆盖 ImageNet、分辨率、80 epoch,更长训练计划、更高分辨率与其他扩散架构的效果仍待检验。消融显示去掉特征融合会造成大幅下降,但额外去掉输出门可部分恢复,说明门控与融合之间存在尚未完全分离的相互作用。此外,DDT-RFE 在 ADE20K 单块探针上 XL 尺度低于 DDT 0.3 mIoU,在 COCO-Stuff 上持平,作者归因于场景复杂度与多尺度信息需求,这一解释在更复杂数据集上的适用范围仍可继续观察。原文中部分公式、表格数值与图注在解析文本中不完整,若需精确复现超参数与逐项数值,应回到原文图表核对。

来源