arXiv 2026年10月7日作者在解耦扩散 Transformer(DDT)的条件编码器中移除 Self-Attention 与 MLP 周围的残差连接,改用零初始化输出门与混合正交注意力初始化保证训练稳定,并把输入 patch 嵌入与各编码器块输出聚合为编码器输出;在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 的设定下,DDT-RFE 在图像分类、语义分割、物体发现、语义对应四类视觉理解任务上整体优于 DDT,且编码器块数更少(L 尺度 12 对 20,XL 尺度 14 对 22),ImageNet 生成 FID 从 8.98 降至 7.68(L)和从 7.27 降至 6.81(XL)。作者在解耦扩散 Transformer(DDT)的条件编码器中移除 Self-Attention 与 MLP 周围的残差连接,改用零初始化输出门与混合正交注意力初始化保证训练稳定,并把输入 patch 嵌入与各编码器块输出聚合为编码器输出;在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 的设定下,DDT-RFE 在图像分类、语义分割、物体发现、语义对应四类视觉理解任务上整体优于 DDT,且编码器块数更少(L 尺度 12 对 20,XL 尺度 14 对 22),ImageNet 生成 FID 从 8.98 降至 7.68(L)和从 7.27 降至 6.81(XL)。去掉条件编码器残差连接并融合多层特征,DDT-RFE 在更少编码器块下同时提升四类视觉理解任务与 ImageNet 生成 FID作者在解耦扩散 Transformer(DDT)的条件编码器中移除 Self-Attention 与 MLP 周围的残差连接,改用零初始化输出门与混合正交注意力初始化保证训练稳定,并把输入 patch 嵌入与各编码器块输出聚合为编码器输出;在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 的设定下,DDT-RFE 在图像分类、语义分割、物体发现、语义对应四类视觉理解任务上整体优于 DDT,且编码器块数更少(L 尺度 12 对 20,XL 尺度 14 对 22),ImageNet 生成 FID 从 8.98 降至 7.68(L)和从 7.27 降至 6.81(XL)。作者在解耦扩散 Transformer(DDT)的条件编码器中移除 Self-Attention 与 MLP 周围的残差连接,改用零初始化输出门与混合正交注意力初始化保证训练稳定,并把输入 patch 嵌入与各编码器块输出聚合为编码器输出;在 ImageNet-1k、分辨率、patch size 2、80 epoch、batch 1024 的设定下,DDT-RFE 在图像分类、语义分割、物体发现、语义对应四类视觉理解任务上整体优于 DDT,且编码器块数更少(L 尺度 12 对 20,XL 尺度 14 对 22),ImageNet 生成 FID 从 8.98 降至 7.68(L)和从 7.27 降至 6.81(XL)。