PCD 把主目标梯度钉在更新方向上,在 ResNet-34/CIFAR-100 的 90% 稀疏度下保住 70.9% 准确率,而对称多目标基线全部崩塌
核心概要
该工作提出 Priority-Constrained Descent(PCD),一种把主目标梯度作为锚点、只在必要时做最小欧氏扭曲以保证每个次要目标获得 τ 比例一阶进展的梯度优化框架,在结构化剪枝、非结构化稀疏加低秩以及合成实验中报告了优于对称多目标方法的逐目标表现与帕累托支配,并给出二、三目标的闭式解与尺度不变性。
深度剖析
PCD 把多目标更新写成一个小型凸二次规划:在所有能保证每个次要目标至少获得 τ 比例最大归一化一阶进展的方向中,取距离主目标梯度欧氏距离最近的那个,因此主目标的系数被结构性地钉在 1,次要目标只以非负乘子进入。 既有梯度类多目标方法(加权和、MGDA、PCGrad、CAGrad 等)把目标视为对称、可互换,追求帕累托稳定;PCD 直接在更新几何中嵌入层级,其归一化方向的零点只对应复合多稳定点(CMS),而 CMS 严格强于帕累托稳定。 论文给出投影与 KKT 刻画、二目标闭式解、三目标 Cramer 法则闭式解、EMA 归一化下的渐近尺度不变性证明,以及 CMS 端点定理;作者同时说明该定理是确定性归一化 QP 的端点刻画,不是随机收敛结论。
在结构化剪枝中,PCD 在八个(架构,数据集)组合、每个压缩目标上都高于所有通用多目标基线;ResNet-34/CIFAR-100 在 90% 稀疏度下保持 70.9% 准确率(未剪枝为 73.3%),而 MGDA 降到 1.2%、FAMO 降到 2.7%、PCGrad 降到 7.4%、CAGrad 降到 7.3%。 论文把这种崩塌归因于目标尺度而非梯度冲突:原始正则项梯度范数约为任务梯度的一到两个数量级,而两者余弦从未超过某一小值;PCD 的逐目标归一化让同一个无量纲 τ 在异质次要目标间保持可解释。 每个配置 5 个随机种子、300 轮、Adam、余弦退火,报告均值为结果;表 1 与表 2 给出 DenseNet-121/CIFAR-10 与 ResNet-34/CIFAR-100 的完整数值,含 FLOPs、延迟与文件大小。
在与剪枝专用与约束式基线的受控对比中,PCD 在压缩区间(约 80% 以上稀疏度)的 47 次匹配比较中 28 次更好、1 次更差、18 次在种子噪声内,且 25/47 的基线工作点被 PCD 自身扫描中的某点帕累托支配。 该对比把训练时原生稀疏度作为唯一变量,排除微调、逐层缩放与随机门控等额外机制,并让每个基线点与平均稀疏度最接近的 PCD 点配对(配对时不看准确率)。 ResNet-34 与 DenseNet-121 在 CIFAR-10/CIFAR-100 上、3 个种子、300 轮,共 28 个基线工作点每配置(330 次运行);论文指出唯一的失败是一次真实交叉,调优标量化在 ResNet-34/CIFAR-100 上以某稀疏度达到某准确率,而 PCD 在同稀疏度略低。
在三目标(交叉熵 + L1 + 核范数)设置中,PCD 在准确率与有效秩两个轴上占优、在参数稀疏度轴上起步较低但随 τ 上升追平基线簇;ResNet-34/CIFAR-100 上保持 71.0% 准确率、92.6% 稀疏度与 24.5 有效秩,而基线在准确率上崩塌并过度压缩。 论文强调两个次要目标并不对齐:L1 逐元素置零,核范数作用于谱、塌缩整个奇异方向;同一个 τ 之所以有意义,是因为约束施加在 EMA 归一化梯度上,要求每个次要目标各自最大归一化进展的同一比例。 ResNet-34 与 Inception 风格模型在 CIFAR-10/CIFAR-100 上、3 个种子、300 轮;除逐轴曲线外还报告支配超体积,并在等基数、每方法单点、替换归一化边界三种变体下重复,PCD 在所有变体下领先。
启示与展望
该结果面向次要目标为正常、凸、下半连续的层级优化场景,典型如结构化剪枝的组 Lasso、非结构化 L1 与核范数正则;作者把框架定位为针对式(1)的“正则项式”层级,即次要目标在主目标极小点处联合稳定。对实践者而言,τ 可作为训练时的连续压缩旋钮,在 ResNet-34/CIFAR-100 上从轻压缩到激进压缩连续移动,论文报告最大资源收益出现在 τ 约 0.1 以内、之后曲线趋于平台。理论保证附着于归一化方向与理想化一阶步,作者说明部署更新会按原始主梯度幅值重缩放以兼容标准优化器步长调度。
作者明确说明未证明算法 1 的收敛性,既无迭代收敛到 CMS 的结论也无收敛速率;部署更新在原始主梯度为零时会被重缩放因子置零,因此存在主目标稳定但非 CMS 的固定点,作者称该分支在全部调优基线研究的运行中从未被接近。定理 4.8 是逐点端点刻画,不构成稳定性结果,且其反向识别依赖自动微分在次微分处返回零的假设,核范数在零矩阵处并不满足。优化器层面,论文报告在 Adam 下每步次要约束符号在约 98.5%–99.8% 的步上保持,而在 SGD 加动量下会翻转 47%–73% 的步,但两者最终落在同一前沿,只是 SGD 控制晚 20–40 轮进入平台。此外,次要约束严格互不相容时 QP 可能不可行,作者称合成实验显示这在实践中概率极低,但仍列为可能的局限;多级优先级层级与自适应 τ 调度被列为后续方向。
