对抗后训练让像素扩散模型补回缺失的高频细节,DeCo 的 FID 从 33.27 降到 28.59
核心概要
该研究在已收敛的像素扩散模型上保留原有扩散或流匹配目标、仅在非高噪声时间步对预测输出加入对抗损失,在 DeCo 与 PixelGen 两个像素骨干上同时改善分布保真度、覆盖度、提示对齐与感知质量,并把这一增益归因于恢复了自然图像缺失的高频功率,而相同流程在测试的潜空间扩散配置上未产生可比增益。
深度剖析
对抗后训练在像素扩散上带来联合增益:DeCo 的 FID 从 33.27 降至 28.59、recall 从 0.361 升至 0.406、DPG Score 从 81.6 升至 83.3,PixelGen 在各项指标上同样改善。 作者称这是首个针对像素扩散的对抗后训练系统性研究,且不改变模型架构与采样流程、不做蒸馏、不减少采样步数、不使用偏好标签或奖励模型。 两个像素骨干,均从公开检查点在同一 BLIP3o-60k 数据上微调,GAN 与无 GAN 对照共享起始检查点、数据与训练时长,并在 DPG-Bench 与 COCO-30k 上按提示对齐、分布保真度与多样性、无参考质量四组指标评估。
增益来自补回缺失的自然图像高频统计:DeCo 的径向功率谱斜率从 2.59 移到 2.24,接近真实 COCO 图像约 2.0 的自然幂律,高频带功率提升约 0.35 dex。 频率带与幂律分析把“更清晰”定位为可测量的频谱功率恢复,而非笼统的锐化;作者用频谱匹配的 unsharp-mask 对照说明普通锐化只能恢复 GAN 增益的一小部分。 对生成图像亮度通道加二维 Hann 窗后做二维 FFT 并按等频率环方位平均,逐图平均得到功率—频率曲线并最小二乘拟合斜率;同时报告频带功率占比与未归一化高频对数功率变化。
该增益不是模式坍缩或记忆:recall 上升而非下降,DINOv2 最近邻相似度均值保持 0.586 不变、最大值从 0.943 降到 0.929。 通常对抗训练会牺牲多样性,这里在受限时间步上作为后训练项加入,因而在增加高频的同时提升覆盖度,并用最近邻、recall 与匹配步数的无 GAN SFT 对照排除记忆、模式丢弃与额外优化等简单解释。 用冻结 DINOv2 编码器计算生成图与训练图的余弦相似度并取最大值作为最近邻分数,报告评估集上的均值与最大值;所有增益均与匹配步数的无 GAN SFT 对照比较。
感知损失是另一条锐化路径但代价不同:它也提高高频与拉普拉斯锐度,却降低饱和度、对比度与色彩丰富度,并恶化 FID、pFID 与 DPG Score;而相同流程在测试的潜空间扩散配置上未产生可比联合增益,解码高频几乎不增加。 匹配的感知损失对照把对抗校正与“通用锐化”区分开,像素—潜空间对比则指出对最终图像统计的直接输出访问是决定成败的关键因素。 DeCo 上感知臂把 FID 恶化到 34.14、DPG Score 降到 81.4,而 GAN 为 28.59 与 83.3;SANA 与 PixArt 的高频带占比变化很小,且通过冻结 VAE 的扰动探针测得解码高频响应更弱。
启示与展望
该结果面向已收敛的多步文本到图像像素扩散模型,作为后训练质量校正使用:保留原有扩散或流匹配目标,仅在非高噪声时间步对预测输出加对抗损失,不改变架构与采样流程。作者在 DeCo 与 PixelGen 两个像素骨干上验证,并给出判别器设计、噪声门与对抗权重的操作点趋势,供按目标指标平衡选择。对使用潜空间扩散并依赖冻结解码器的团队,本文的像素—潜空间对比说明这类设置下未必能获得同样的联合增益。
判别器设计、噪声门与对抗权重只被报告为经验趋势与操作点,作者明确表示不定义完整排序、也不给出对所有指标普遍最优的配置。潜空间一侧只测试了 PixArt 与 SANA 的若干配置,因此“输出访问”作为机制的解释范围仍待更多骨干检验。此外,频谱诊断的三种百分比口径归一化与评估集不同,作者提示不应直接数值比较;若只读到摘要或缺少图表,具体数值与消融细节需要回到正文核对。
