研究者发现高 BOS 汇聚注意力头是冗余组件,据此剪枝在 Gemma-3、Llama-3.1 与 Qwen3 上比权重和激活准则更可靠地保留下游任务性能
核心概要
该工作识别出 BOS 汇聚现象是驱动大语言模型层级冗余敏感性的关键机制,指出高 BOS 汇聚分数的注意力头(尤其在深层)对预测性能贡献很小、充当多余注意力权重的倾倒场,并提出一种简单剪枝策略移除高 BOS 汇聚头;在 Gemma-3、Llama-3.1 和 Qwen3 上的实验表明,该策略在下游任务保留方面比基于权重和激活的准则更可靠地识别冗余 Transformer 组件,在低到中等剪枝比例下接近稠密基线,且高汇聚分数头在上下文长度增长时仍持续聚焦于 BOS。
Figure 1: Attention weights of a representative <BOS> sink head (L26, H0) in Gemma-3-4B. The heatmap reveals a stark attention sink pattern where query tokens disproportionately attend to the <BOS> token during an MMLU task.
arXiv深度剖析
论文将 BOS 汇聚现象确立为驱动大语言模型层级冗余敏感性的关键机制,说明高 BOS 汇聚分数的注意力头与功能冗余强相关。 此前大语言模型存在显著冗余,但为何某些组件(尤其是较高层)更冗余缺乏系统性解释;该工作把注意力结构属性与层级冗余联系起来。 基于对注意力头 BOS 汇聚分数的分析,并结合在 Gemma-3、Llama-3.1 和 Qwen3 上的实验观察。
高 BOS 汇聚分数的注意力头,尤其在深层,对预测性能贡献很小,实际上充当多余注意力权重的倾倒场。 把冗余从笼统的参数量或激活幅度问题,重新表述为特定注意力头在功能上可被移除的问题。 论文报告这些头对预测性能贡献很小,并在多个模型家族上观察到该模式。
提出一种简单剪枝策略,移除高 BOS 汇聚头,在下游任务保留方面比基于权重和激活的准则更可靠地识别冗余 Transformer 组件。 与基于幅度的方法相比,该策略以注意力结构属性为更直接的压缩依据。 在 Gemma-3、Llama-3.1 和 Qwen3 上实验,低到中等剪枝比例下接近稠密基线。
高汇聚分数的头在上下文长度增长时仍持续聚焦于 BOS。 说明该汇聚行为不是短上下文下的偶然现象,而是随上下文长度保持的结构特征。 论文报告随上下文长度增长的观察结果。
启示与展望
该结果面向需要压缩大语言模型的研究者与工程实践者,适用于以注意力头为单位的剪枝场景,并在 Gemma-3、Llama-3.1 和 Qwen3 上得到验证。它提示可以按 BOS 汇聚分数排序来挑选候选冗余头,在低到中等剪枝比例下保持接近稠密基线的下游任务表现。对于关注层级冗余机制的分析工作,这一结构性指标也可作为观察深层注意力行为的切入点。
摘要未列出具体下游任务、剪枝比例、评价指标与数值结果,因此难以判断相对稠密基线的实际差距以及与其他准则的量化对比。高 BOS 汇聚头在不同模型家族、不同层数与不同上下文长度下的稳定性,以及该准则与权重、激活准则在更高剪枝比例下的表现差异,仍需结合正文实验细节来评估。此外,BOS 汇聚现象与功能冗余之间的关联是观察性的,其因果方向与机制解释有待进一步工作。
