AWT 用激活统计对角预条件,在 Llama、Ministral、Qwen 上把张量网络压缩的困惑度差距缩小 12–60%
核心概要
作者提出激活感知权重张量化(AWT):一种免训练、与求解器无关的校准期预条件方法,在标准 TT/TTN 分解前用激活导出的对角缩放对权重矩阵做等价重参数化,部署时仅需输入端逐元素缩放。在 Llama 3.1 8B、Ministral 8B、Qwen2.5 7B 上,AWT 在 2–6 倍压缩下一致优于原始张量化:单算子替换缩小 12–35% 的 WikiText 困惑度差距,Llama 多算子后缀替换缩小 27–60%,并迁移到 HellaSwag 与 ARC-Challenge。
深度剖析
AWT 把激活感知的等价重参数化从量化迁移到张量网络分解:先用缓存输入激活计算逐通道对角缩放,对权重矩阵做右预条件,再交给未改动的 TT/TTN 求解器分解,部署时把逆缩放施加到层输入。 此前张量化后训练压缩是激活盲的,标准 TT/TTN 后端最小化权重空间各向同性重构目标;AWT 在不改变张量化形状、拓扑、秩预算与求解器的前提下,把激活信息注入分解。 方法在 Llama 3.1 8B、Ministral 8B、Qwen2.5 7B 上验证,覆盖 TT、TTN4、TTN8 后端、七种稠密 Transformer 算子与 2–6 倍压缩;校准与度量缓存分离,校准样本与下游评测样本不相交。
对角预条件等价于列加权 Frobenius 重构代理,使激活更强的输入通道被拟合得更准,从而降低激活条件下的输出误差。 论文给出恒等式,把张量化误差与激活条件下的功能失真联系起来,说明为何功能保真度最优的缩放强度并不等于权重空间重构误差最优的强度。 在匹配参数预算下,中等激活重加权降低相对输出误差;随缩放强度增大权重误差继续下降,但输出误差最优出现在中等强度,且输出误差变化比权重误差变化更能预测困惑度变化。
在单算子替换与多算子后缀替换中,AWT 一致优于原始张量化,且多算子联合替换时绝对增益更大,说明激活感知预条件有助于控制张量化误差在模型内的累积。 增益跨三个模型家族、三种压缩比、七种算子类型与 TT/TTN 后端保持,并迁移到 HellaSwag 与 ARC-Challenge 下游任务。 单算子替换缩小 12–35% 的 WikiText 困惑度差距;Llama 后缀替换在注意力组与全部七个矩阵设置下缩小 27–60%;下游任务绝对增益较小,HellaSwag 提升约 0.1–0.5 个百分点量级,ARC-Challenge 提升约 0.1–0.3 个百分点量级。
对角限制是稳健性—模块化权衡,而非对角协方差假设:稠密全协方差 oracle 在自身加权目标上 80/81 例胜出,但对角 AWT 在 53/81 例给出更好的留出功能保真度。 论文用协方差分析说明激活强烈非对角(对角协方差质量仅 0.0320/0.1415/0.2122,非对角 Frobenius 比 0.9838/0.9255/0.8850),对角 AWT 放弃该目标上的最优性,换取原始通道布局、无稠密部署变换与更轻的统计估计负担。 离线算子级分析覆盖 81 例;按模型看,Llama 上全协方差与对角在留出输出误差上为 13 比 14,Ministral 为 10 比 17,Qwen 为 5 比 22。
启示与展望
AWT 面向使用固定张量化形状、拓扑与秩预算的 TT/TTN 后训练压缩流程,适用于希望在不重训、不更换求解器的前提下提升功能保真度的工程与研究场景。它需要一小份无标签校准集来估计逐通道激活统计,部署时只增加输入端逐元素缩放,可融合进周边内核。多算子后缀替换结果显示,当多个算子被联合压缩、误差在模型内累积时,AWT 的相对收益更明显,因此它最适合作为多算子压缩流水线中的默认预条件步骤。方法也与量化、剪枝、矩阵分解互补:可先施加 AWT 再张量化,并对得到的张量网络核进一步量化。
张量化质量依赖维度分解、模式排序、秩分配与 TTN 拓扑等设计选择,论文保持固定或仅部分扫描,这些选择与激活感知预条件的联合优化仍是开放问题。运行时分析隔离了 AWT 自身的开销,但端到端延迟取决于优化后的 TT/TTN 内核与硬件实现。校准统计来自小规模输入集,可能无法覆盖全部下游分布。多算子后缀实验已超出孤立替换,但全模型压缩仍需跨层与跨算子的协调选择。此外,附录中部分逐算子误差表在加载文本中数值缺失,因此这些细粒度对比无法在此完整复述。
