跳到主要内容
返回时间线
arXiv来源发表:

TopK-Guided 用有界 token 级稀疏与敏感度感知的块级预算分配,在 Llama-2 与 Llama-3 上同时改善困惑度与下游准确率

核心概要

TopK-Guided 是一种免训练激活稀疏方法,把有界的 token 级稀疏自适应与敏感度感知的块级预算分配结合起来,在 Llama-2 和 Llama-3 上相对 TEAL 与 WINA 一致改善困惑度和下游准确率,同时保持与 WINA 基本相同的稀疏相关投影计算量,且在高稀疏度下增益最大;消融显示两个组件提供互补改进。

Source-provided article image: TopK-Guided: Adaptive, Budget-Aware Activation Sparsity for Efficient LLM Inference
Figure 1 ·

Figure 1: Per-block sensitivity e i e_{i} (Eq. 4 ) on Llama-2-7B and Llama-3-8B, shown at four probe levels s ¯ ∈ { 0.2 , 0.4 , 0.6 , 0.8 } \bar{s}\in\{0.2,0.4,0.6,0.8\} .

arXiv

深度剖析

提出 TopK-Guided,一种免训练激活稀疏方法,将 token 级稀疏自适应限制在可控范围内,并按各 transformer 块的敏感度分配稀疏预算。 既有免训练方法各有取舍:TEAL 等阈值方法按 token 自适应稀疏度但无法严格约束实际稀疏度,WINA 等 TopK 方法强制固定稀疏度却对所有 token 使用同一预算;两者还对所有 transformer 块使用同一预算,尽管块间敏感度差异很大。 摘要报告在 Llama-2 与 Llama-3 模型上相对 TEAL 和 WINA 的一致改进,并说明消融显示两个组件互补;具体数值、模型规模与评测集合未在摘要中给出。

在保持与 WINA 基本相同的稀疏相关投影计算量的前提下,TopK-Guided 在困惑度和下游准确率上均优于 TEAL 与 WINA,且高稀疏度时增益最大。 把稀疏度控制与块级预算分配解耦后,可在不增加投影计算的前提下获得质量提升,说明固定 token 预算与统一块预算并非必要取舍。 摘要层面的对比结论,覆盖 Llama-2 与 Llama-3;摘要未给出具体困惑度数值、准确率数字或稀疏度取值。

消融实验表明 token 级有界自适应与块级敏感度感知预算两个组件带来互补改进。 说明两类既有方法的局限分别由不同组件处理,而非单一机制同时解决。 摘要仅陈述消融结论,未列出消融配置、指标或数值。

启示与展望

该方法面向免训练的 LLM 推理加速场景,适用于希望在不重新训练的前提下降低稀疏相关投影计算的研究者与工程团队;摘要显示其验证范围是 Llama-2 与 Llama-3 模型,并强调在保持与 WINA 基本相同的稀疏相关投影计算量的同时改善质量,因此其定位是同等计算预算下的质量提升,而非改变计算量本身。高稀疏度设置是收益最明显的区间,适合显存或延迟受限的部署。

摘要未给出困惑度与下游准确率的具体数值、所用模型规模、评测数据集以及稀疏度取值,因此改进幅度与适用区间仍需查看正文表格;块敏感度如何度量与预算如何分配的具体机制、以及是否在 Llama 系列之外的模型或不同硬件上验证,也属于待确认的开放问题。

来源