跳到主要内容
返回时间线
arXiv来源发表:

不重训模型、只保留注意力权重最高的少量token,九个检查点的有效注意力集合大小从7到283不等,且上下文越长所需集合越大

核心概要

该研究在不重训模型的前提下,在每个头、层和查询处只保留注意力权重最高的若干token并保持其原始权重不变,通过测量负对数似然(NLL)的上升来估计维持给定损失容差所需的“有效注意力集合大小”,发现较小的集合即可让NLL接近全注意力基线、基于注意力的选择明显优于随机选择、所需集合大小随上下文延长而增大但其占上下文的比例下降,并且在固定标注支持事实的BABILong实验中,额外背景会把支持token挤下注意力排名并降低其注意力质量,而对保留权重做重归一化可大幅减小所需集合大小。

AI-generated editorial illustration: Retrieval Capacity of Self-Attention Under Competition

深度剖析

论文提出“有用token”框架,把未知的有用集合与可观测的选中集合区分开,并给出把排名错误与必须保留的token数量联系起来的恢复界。 此前Mudarisov等人的工作只观察到按最大注意力权重选出的集合在加权值向量空间中比同规模随机集合具有更强的几何分离性;本文把这一观察推进为可检验的功能性框架,并推导出排名反转数与恢复有用集合所需规模之间的定量关系。 形式化命题与证明(附录A.1的恢复界),配合在九个解码器检查点上的实证测量;有用集合本身未被观测,实验检验的是选中集合及其后果。

在九个检查点上,按注意力或贡献幅度选出的集合在几何上比同规模随机集合更分离,且保留这些token时NLL上升远小于随机选择;但保持平均损失在给定容差内所需的集合大小在不同模型间差异很大。 论文把几何分离与损失保持放在一起比较,指出几何分离本身并不足以确立模型损失被保持,从而把“结构化选择”从描述性观察转为功能性测量。 九个检查点(Qwen-2.5-1.5B/7B、Gemma-7B、Gemma-2-9B、Llama-2-7B、Llama-3-8B、Llama-3.2-1B、Mistral-7B-v0.3、Mistral-Small-24B-Base-2501),每个模型每个语料50篇文档,OpenWebText与WikiText-103;表2给出各语料的具体估计,例如Gemma-7B在1%容差下为283(OpenWebText),Mistral-7B为51,Gemma-2-9B在5%容差下为12。

在固定预测目标的情况下延长上下文会增大所需集合大小,但其占上下文的比例在测试范围内下降;在BABILong qa1中固定标注支持事实、只增加背景文本时,支持token在注意力排名中下移、注意力质量减少、在固定64个最高权重token中的召回下降,多个模型所需的集合大小随之增大。 自然上下文延长同时改变了有用信息与竞争,因此论文补充了固定标注支持的受控实验,把竞争因素单独分离出来;同时报告了成对排名概率下降但竞争者数量增加导致总体排名更差的机制。 匹配目标的上下文长度实验覆盖256到2048,三个模型在两个语料上结果完整(32个计划条件中27个完成);BABILong每个背景条件100个QA样例、86个通过验证,跨模型平均支持位移增加约3.6倍、注意力质量降至初始的约0.4倍、召回@64下降63.8个百分点。

对保留的注意力权重做重归一化可以大幅减小所需集合大小,说明有效集合大小还取决于被选表示如何被组合;条件性理论模型说明竞争与注意力质量保持如何在没有更多可检索信息的情况下产生增长的集合大小。 这把解释从“排名”扩展到“聚合”,并给出一个理想化任务损失例子:即使所有值向量相同,仅靠保持输出幅度也会产生增长的删除集合需求。 语言模型与QA两组归一化对照(表9、表10),例如Gemma-7B在5%注意力排名下从226降到7;理论结果为带明确假设的条件性命题,作者说明这些假设未在受测模型上验证。

启示与展望

这项工作面向研究长上下文语言模型注意力行为的读者,以及需要评估注意力稀疏化或缓存缩减方案的研究者。它提供了一套可复用的测量流程:在给定损失容差下估计有效注意力集合大小,并分别考察上下文长度、竞争与聚合方式的影响。论文明确说明该测量适用于所评估的模型、语料与容差设置,且干预在选前仍计算稠密注意力,因此结果用于理解预测性能的退化,而不是直接给出推理加速。

有用集合本身未被观测,注意力权重本身并不确立相关性,因此有效集合大小与局部有用集合规模之间的关系仍取决于排名错误、被组合的值以及后续计算的敏感性。几何分离与损失退化之间的相关性在小集合被剔除后减弱甚至变号,说明几何量不宜单独作为功能充分性的预测指标。BABILong的标注支持只是相关性的部分参照,平均损失可能掩盖单例变化,保持一个本身较弱的全模型基线也不等于任务成功。若干条件未解析或未完成(如Gemma在2K、Mistral在4K的搜索上限,以及Mistral-7B在WikiText-103上的缺失),阈值估计依赖于已评估的集合大小。理论模型是条件性的,其假设未在受测模型上验证,论文也未主张普适的缩放律。

来源