arXiv来源发表:
低秩压缩不再一套秩走到底:每个词自己选路径,Llama-2-7B下游平均准确率提高7.6个百分点
导语
低秩压缩模型推理时不再对所有词用同一套秩,而是每个Transformer块用一个轻量路由器为每个词挑选嵌套低秩路径,在相同平均激活参数预算下把Llama-2-7B下游平均准确率提高7.6个百分点。
正文
压缩后的语言模型开始按词分配算力:同一个Transformer块里,不同词可以走不同数量的低秩分量,而不是整段输入共用一套固定秩。 此前的低秩压缩在推理时给每个词分配相同的计算量,秩在压缩完成时就固定下来。 在Llama-2-7B上,相同平均激活参数预算下,动态选路的LRCC-9把下游平均准确率提高到62.7%,最好的静态基线为55.1%,相差7.6个百分点。
做法是在已有的嵌套低秩分解上只训练路由器:每个块一个线性路由器,按输入激活在少量路径中做硬选择,被选中的路径决定该块各线性层激活多少秩。 路径来自Swift-SVD按目标代价分配的整模型秩方案,低秩因子和预训练权重在训练中保持冻结,只有路由器被更新。 路由器在WikiText-2的256条2048词元样本上训练,目标代价从0.975按0.025步长退火到0.3,一次训练产出28个检查点。
接下来
下一步可以在嵌套子空间模型上验证条件秩选择,例如先用微调细化分解后的权重再训练路由器;延迟收益目前只在批大小1解码上测量,预填充和更大批量的实现优化仍是空白;路径结构在路由器训练前就已固定,联合学习路径结构与路由策略是另一条可走的路。
路由器只在WikiText-2上训练,实际部署代价在多个未见数据集上接近目标,但这一结论目前覆盖的模型与任务仍有限;路径数量超过五之后收益很小,而编译时间随路径数明显上升,33路径的模型甚至无法完成编译;预填充实现仍按全秩计算再掩码,路由带来的计算节省尚未完全兑现。
