Just Leaf It:用层级类别剪枝加速扩散分类器
核心概要
该工作提出层级扩散分类器(HDC),利用数据集标签的父子层级结构,在剪枝阶段逐层用较少的蒙特卡洛采样估计ε-预测误差并只保留误差最低的若干节点,再对保留下来的叶节点执行经典扩散分类,从而在ImageNet-1K上以Stable Diffusion 2.0实现约60%的推理加速(1600秒降至650秒)或在几乎不增加时间的情况下把逐类准确率从64.90%提升到65.16%。
Figure 2. Overview of our Hierarchical Diffusion Classifier (HDC). Starting with an input image x, noise ε ∼N(0, I) is added to generate a noisy image, resulting in xt for multiple timesteps t. Next, we use the diffusion classifier with a reduced number of ε-predictions and hierarchical conditioning prompts like “A photo of a {synclass / class name}” to progressively refine the classification through multiple levels of the label tree. By doing so, we keep track of the most promising classes (highlighted in green) and ignore the rest (highlighted in red). The set of selected nodes during the pruning stage is denoted as Sd
· 第 4 页深度剖析
提出免训练的层级扩散分类器(HDC),把扩散分类从“评估全部类别”改为“沿标签树逐层剪枝后再分类”。 已有扩散分类器(如Li等、Clark等)对每张图评估所有类别,推理时间随类别数线性增长;HDC改为在剪枝阶段用较少的蒙特卡洛样本估计各synset的ε-预测误差,按剪枝比例Kd做top-k保留,只在剩余叶节点上运行经典扩散分类。 论文给出算法1的完整流程与式(7)(8)(9)的形式化定义,并在ImageNet-1K(7层树,从第3层开始遍历)与CIFAR-100(自建树)上做了实验。
在ImageNet-1K上,固定剪枝策略(Strategy 1,Kd=0.5)在提速约38.75%的同时把逐类准确率从64.90%提升到65.16%。 相对基线扩散分类器1600秒、64.90%的结果,HDC Strategy 1用980秒达到65.16%,即在不牺牲精度的情况下减少近40%推理时间,并报告为扩散分类器的新最优精度。 表5给出逐类平均准确率与时间对比,表1给出Top-1/Top-3/Top-5与时间;使用Stable Diffusion 2.0,512×512分辨率,l2范数计算ε-预测,时间步均匀采样自[1,1000]。
动态剪枝策略(Strategy 2,保留最小误差两个标准差内的节点)把推理时间进一步降到650秒,约60%加速,准确率降至63.33%。 与固定剪枝相比,动态剪枝按误差分布自适应选择候选,提供更偏速度的取舍点,说明HDC可在速度与精度之间连续调节。 表1与表5报告650秒、59.38%加速、Top-1为63.20%(表1)与逐类63.33%(表5);CIFAR-100上Strategy 2(Kd=0.4)报告+3.3个百分点准确率与约34%加速。
HDC的剪枝比例、扩散模型版本与提示模板都会影响速度—精度取舍,且默认提示“A photo of a”表现最好。 论文比较了SD 1.4/2.0/2.1与多种提示模板,显示SD 2.0在Strategy 1下取得最高Top-1(64.14%,时间980秒),而“A bad photo of a”“A low-resolution photo of a”等模板带来准确率下降。 表2给出三个SD版本在两种策略下的逐类/整体Top-1与时间;表4给出四种提示模板在两种策略下的Top-1/Top-3/Top-5。
启示与展望
该结果适用于具有明确层级标签结构的数据集(如基于WordNet的ImageNet-1K,论文使用7层树并从第3层开始遍历),也适用于可自建层级的CIFAR-100;方法免训练,可直接叠加在已有条件扩散模型(论文验证SD 1.4/2.0/2.1)之上,并支持在不重新训练的情况下增删类别标签。对希望在大规模分类中控制推理成本、或需要按场景在速度与精度间调节的读者,HDC提供了一条可操作的路径。
论文指出效率收益依赖标签树的深度与平衡性,浅层级或弱父子关系的数据集收益可能有限;层级可由LLM自底向上构建或用贪心扩展细化,但论文未给出这些替代构建方式的完整评测。此外,不同类别推理时间差异明显(如“snail”221秒对“keyboard space bar”1400秒),提示模板与SD版本也会改变取舍,读者在迁移到自有数据时仍需自行验证剪枝比例与层级质量的影响。
