把粒子扩张推迟到Transformer后层并引入时间相关评分规则调度,DDM在ImageNet-256²上以单阶段从零训练实现4步4.48 FID、50步2.38 FID
核心概要
该工作针对分布扩散模型(DDM)扩展中的两个障碍——多粒子训练开销随粒子数增长、以及全局固定的评分规则超参数迫使采样预算只能取单一权衡——提出把粒子扩张推迟到Transformer后层、并引入受Biroli2024动力学区间启发的时间相关评分规则调度,配合DiT潜空间设置,使DDM训练在类条件ImageNet-256²上可行,用DiT-XL/2从零单阶段训练、无教师、无自蒸馏、无JVP即达到4步4.48 FID与50步2.38 FID,且同一配方可迁移到文生图。
深度剖析
该工作把DDM的粒子扩张推迟到Transformer的后层,从而缓解多粒子训练开销随粒子数增长的问题。 此前DDM的多粒子训练开销随粒子数线性增长,是扩展到现代图像生成设置的两大障碍之一;把粒子扩张放到后层改变了开销的分布方式。 摘要层面陈述的架构改动,配合DiT潜空间设置在ImageNet-256²上的训练结果作为支撑;正文未在已加载文本中给出该改动的逐层消融细节。
该工作引入时间相关评分规则调度,用随采样预算变化的超参数取代全局固定超参数,从而缓解单一权衡问题。 此前DDM使用全局固定的评分规则超参数,被迫在所有采样预算上取同一个权衡;时间相关调度让不同时间步可以采用不同权衡,其动机来自Biroli2024的动力学区间。 摘要层面陈述的方法改动,并以4步到50步NFE区间内FID不退化作为间接证据;具体调度形式与消融在已加载文本中未展开。
在DiT潜空间设置下,该配方使DDM在类条件ImageNet-256²上达到4步4.48 FID、50步2.38 FID,且来自单阶段从零训练的单模型。 此前的DDM难以扩展到现代图像生成规模;该结果说明无需教师模型、自蒸馏或JVP也能在ImageNet-256²上取得可用的少步生成质量。 摘要给出的具体FID数值与训练条件(DiT-XL/2、单阶段、从零、无教师、无自蒸馏、无JVP);已加载文本未提供完整实验表格与统计细节。
所得生成器是随机少步生成器,其FID在采样预算从4增至50 NFE时不退化,且同一配方可迁移到文生图。 常见少步生成方法在采样步数增加时质量表现各异;这里报告的是FID随NFE增加不退化,并给出跨任务迁移的证据。 摘要层面的结果陈述,覆盖4到50 NFE区间与文生图迁移;具体文生图指标在已加载文本中未给出。
启示与展望
该结果面向类条件ImageNet-256²的DiT-XL/2潜空间设置,训练方式为单阶段从零训练,不使用教师、自蒸馏或JVP;同一配方被报告可迁移到文生图。对读者而言,这意味着少步随机生成器可以在不引入蒸馏流水线的条件下被训练出来,适用于希望以较少采样步数获得可用图像质量、且愿意承担训练期额外开销的场景。
已加载文本为摘要与元数据层面的证据,缺少完整实验表格、逐层消融与调度形式的细节,因此时间相关评分规则调度的具体实现、粒子扩张推迟到后层带来的开销变化曲线、以及文生图迁移的具体指标,仍是读者需要打开原文确认的开放问题;此外,4步4.48 FID与50步2.38 FID是在DiT-XL/2与类条件ImageNet-256²这一特定设置下报告的,向其他分辨率、其他数据集与其他骨干的推广程度尚待观察。
