把矩阵乘法换成结合代数积:110M参数模型生成吞吐提升6.2–7.8%,但GSM8K、MBPP、IFEval三项指标同时下降
核心概要
该工作提出用结合代数乘法表替换Transformer投影中的普通矩阵乘法,在保留全部学习权重块与参数量的前提下把q=2情形的双线性秩从Strassen 2×2算法的7降到6,并在约110M参数、12.3B token的对照预训练中观察到四个提示域上6.2–7.8%的端到端生成吞吐提升,同时GSM8K、IFEval、MBPP三项下游指标均低于稠密基线。
深度剖析
作者把"乘法表"本身当作架构选择:不再固定普通矩阵乘积去寻找更快的求值算法,而是保留同一批学习到的权重块,改用一张更稀疏的交互表,使q=2情形只需6个块GEMM而非8个。 此前Strassen及后续快速矩阵乘法工作(含自动化搜索)都保持目标乘积不变、只改变求值算法;这里改变的是乘积本身,且权重块仍是独立学习参数。 论文给出结合性证明(命题3.1)与Alder–Strassen下界论证,说明该乘法表的双线性秩为6,达到该表的最优;q=2时对比Strassen 2×2算法的秩7。
构造可推广为有向图族:顶点为对角槽、边为对角外交互槽,边–边乘积为零;在物理块大小固定、组数增长时,方阵运算量呈矩阵维度的二次阶。 给出了可随层宽增长的代数族,并推导出GPU执行的有限形状约束(如三个轴至少128时允许的组数),把代数规模与物理块大小作为两个独立选择。 命题5.1给出MAC计数与二次阶结论,并说明该阶不需要标量级叶子块;附录F在Qwen3-32B形状上测得Q延迟随规模八倍增长的log–log斜率为2.01,作者明确称这是对四个实测尺寸的描述,与命题5.1的精确二次算术界分开。
该行式投影可实现为矩形分块、与因果掩码和KV缓存解码兼容,训练时并行评估所有行类型,解码时只算新位置的一行。 把代数构造落到Transformer投影层面,给出参数量、矩形代价、梯度支撑与因果性命题,并说明权重库在所有行类型上联合暴露、整体作用为单射。 命题4.1给出参数量与代价公式,命题6.1给出因果性证明;附录B给出与正向块支撑一致的向量–雅可比公式,说明前向加反向等于三次前向的MAC量。
在约110M参数、12.3B token、仅FFN乘法律不同的两个解码器LM对照中,代数模型在Code、Math、QA、WMT ru–en四个提示域吞吐均更高(6.2–7.8%),但GSM8K、IFEval、MBPP三项指标均更低。 这是该构造的小规模可行性与可训练性检验:作者明确把它定位为可行性检查,而非等质量或等训练时间下的优势证明。 两模型各训练一次,架构、数据、优化配方一致,仅FFN乘法律不同;吞吐测量每域100条提示、四次测量保留三次,报告95%置信区间;下游用lm-eval-harness评测,GSM8K五样本、IFEval与MBPP零样本,作者指出标准误只反映任务样本不确定性而非训练随机性。
启示与展望
该结果面向希望在保留权重库与参数量的前提下降低投影算术成本的架构与系统研究者,适用于固定物理块大小、组数可增长的方阵投影设定,以及支持因果掩码与KV缓存解码的行式矩形投影。核级测量覆盖Qwen3-1.7B/4B/8B、Qwen3-30B-A3B专家、DeepSeek-V3专家与Qwen3-32B等公开形状,使用合成BF16张量与FP32累加;预训练检验限于约110M参数、12.3B token、仅替换FFN投影的一种递归律。作者指出,把代数扩展到更大规模、代数注意力、更大模型与重复随机种子仍是待做工作,附录G给出了代数注意力分数的独立扩展推导,但实验使用稠密注意力。
预训练只跑了一次、一个规模,作者明确说这不足以确立等质量或等训练时间下的优势;吞吐增益小于FFN算术削减幅度,因为注意力、LM头、采样、分词与内存流量也参与,且生成长度不同,需要定长重复的全模型计时来分离层效应。核级基准用合成张量,报告的是投影/FFN级加速而非端到端Transformer加速,MoE测量不含分发与通信,DeepSeek维度用BF16而生产FP8实现不在比较范围内;性能计数器不可用,因此没有基于计数器的瓶颈归因。此外,代数规模增长会改变每行的特征交互与对角外参数使用频率,计算缩放本身不构成保质量的缩放律。本证据包为全文,但表格中的部分数值以分数形式呈现,若需精确比较仍应回到原文表格。
