DC-SAE 用语义加像素双分支把图像压缩到 32 倍,ImageNet 上 gFID 3.37、PSNR 29.79,并比 DC-AE 快 4.41 倍
核心概要
北京大学与新加坡科技设计大学提出 DC-SAE 解耦紧凑语义自编码器,用冻结语义编码器提供生成友好的紧凑潜空间、用可训练像素编码器保留低层细节,在 32 倍空间压缩下于 ImageNet 取得 29.79 PSNR 与 3.37 gFID,较 DC-AE 在 PSNR 上提升 13.5%、gFID 上提升 54.9%,并实现 4.41 倍加速,同时一个 B 参数 DiT 在 GenEval 得 0.84、DPG-Bench 得 86.007。
深度剖析
DC-SAE 把高压缩分词器拆成两条互补支路:冻结的语义编码器负责结构化、易被扩散模型学习的潜表示,从零训练的像素编码器负责纹理、颜色统计、局部边界与高频细节,两者按通道拼接后由轻量投影融合并联合解码。 此前的表示自编码器(RAE)用预训练语义编码器替换 VAE 编码器以加快扩散训练,但通常局限于中等压缩,直接推到 32 倍深度压缩会严重损失重建质量;DC-SAE 用一条不受约束的像素支路补回低层信息,从而把语义自编码器扩展到深度压缩区间。 论文报告在标准压缩设置下,语义自编码器约 23.13 PSNR,加入像素支路后达到 29.79 PSNR 与 0.17 rFID;掩码分析显示遮住语义分量对重建影响很小,遮住像素分量则重建严重退化,说明高保真重建主要来自像素支路。
论文指出把压缩放在语义抽象之后(post-merge,如平均池化、冻结或可学习 merger)会丢弃难以恢复的空间与低层信息,而应在输入层面先压缩(pre-merge),让语义编码器直接在目标 token 预算下形成表示。 这一对比把“压缩发生在语义编码之前还是之后”识别为语义自编码器能否进入深度压缩的关键障碍,而此前 MLLM 式的高压缩视觉分词器多采用先提取稠密 token 再合并的做法。 表 4 中 post-merge 变体一致落后:Qwen-ViT 冻结 merger 为 23.40 PSNR、25.96 gFID,平均池化为 23.07 PSNR、17.71 gFID,可学习 merger 为 23.85 PSNR、16.84 gFID,DINOv2 可学习 merger 为 24.03 PSNR、8.60 gFID;而 pre-merge 的 DINOv2 为 23.13 PSNR、3.31 gFID。
Spatial DeMerger 在解码器一侧把每个紧凑潜 token 展开成一组空间子 token,使扩散模型仍工作在稀疏紧凑潜网格上,而 ViT 解码器获得更密的空间网格以恢复细节。 该设计把“扩散建模用的潜网格”与“图像解码用的 token 网格”解耦,此前的高压缩分词器通常让两者共用同一稀疏网格,从而在解码端形成空间瓶颈。 在 32 倍压缩的 DINOv2 pre-merge 设置下,加入 Spatial DeMerger 持续提升验证 PSNR;在完全冻结、无像素支路的 QwenViT 设置中,原始 merger 从 15.39 提升到 17.52,平均池化从 15.50 提升到 17.64。
DC-SAE 的收益来自语义与像素潜空间的联合自编码训练,而非仅仅把语义特征暴露给 DiT;联合训练在生成收敛上优于先单独训练像素自编码器、再在 DiT 阶段拼接语义潜的 Late-Concat 方案。 这一消融把“联合训练出兼容的语义—像素潜表示”与“事后拼接”区分开,说明生成友好性来自自编码器内部的耦合,而不是语义特征的简单注入。 表 6 中 Late-Concat 重建更好(31.91 PSNR、0.09 rFID)但生成更差,80 轮 gFID 为 5.64 对联合训练的 4.02;用重建质量更接近联合训练的早期检查点 Late-Concat-E 仍为 5.40,排除了单纯的重建—生成冲突解释。
启示与展望
该工作面向需要高压缩潜空间以降低序列长度与计算成本的潜空间图像生成场景,包括类条件 ImageNet 生成与文本到图像生成;其结论适用于以冻结语义编码器加可训练像素编码器构建分词器、并在冻结潜空间上训练 DiT 的设定。对希望在不牺牲重建保真度的前提下提高压缩率、或希望缩短扩散训练收敛步数的研究者和工程团队,DC-SAE 提供了可直接借鉴的架构选择:输入级 pre-merge 压缩、双分支联合训练、以及仅在解码端展开的 Spatial DeMerger。论文也指出其方法与 VFM 对齐、自监督 token 损失、通道掩码等既有技术互补,可能进一步结合使用。
文本到图像部分仅使用一个 B 参数 DiT 配置,训练数据为内部数据子集加 LAION-COCO,跨训练规模、数据集与生成器架构的更广泛验证仍属未来工作。论文也说明,虽然观察到语义潜可加速扩散训练、且输入级 pre-merge 压缩优于事后 token 合并,但对语义编码器中哪些属性对生成最重要尚无完整理解,何时更适合 pre-merge 或 post-merge 压缩也缺少原理性解释。此外,首页证据包中的部分数值在正文里以占位形式出现,表格中的若干单元格为空,因此对个别对比数字的完整核对仍需回到原文表格。
