跳到主要内容
返回时间线
arXiv来源发表:

低精度 Transformer 推理中随机舍入与就近舍入的站点级权衡:MLP 用 SR、注意力头用 RN 可将困惑度压至全精度参考的 1.10 倍

相关研究与后续进展

核心概要

该工作将 PRISM 向量化舍入库扩展为可变精度随机舍入(VPSR),在固定数值格式、仅改变各运算位点舍入规则的条件下对 DistilGPT-2 做仿真,并用线性投影前向误差界与 softmax 交叉熵的二阶分解解释位点差异:在 6 位有效位下 MLP 用 SR 的困惑度为全精度参考的 1.15 倍而 RN 为 2.21 倍,语言模型头处顺序反转,混合配置(MLP 输出 6 位、MLP 用 SR、头用 RN)把困惑度带到 1.10 倍,较同位宽 RN 降低 28%。

Source-provided article image: Stochastic Rounding in Low-Precision Transformer Inference: A Variable-Precision Emulation Study of a Small GPT-2
Figure 1 ·

Figure 1: Complete DistilGPT-2 architecture and evaluation path. Token and position

arXiv · 第 7 页

深度剖析

舍入规则的最优选择取决于网络中的具体位点,而非全局统一策略。 此前低精度推理通常把舍入规则当作整体设定,这里固定数值格式、只改变单个运算位点的舍入规则,从而把位点效应单独分离出来。 在 DistilGPT-2、t=6 有效位下,MLP 中 SR 使困惑度升至全精度参考的 1.15 倍,RN 为 2.21 倍;语言模型头处顺序反转。

线性投影的前向误差包络随归约长度 n 增长,SR 为 O(√n·u),RN 为 O(n·u),差距在低精度下迅速扩大。 给出了概率化的前向误差界,把 SR 与 RN 的差异写成归约长度的显式函数,并指出该差距在较长的 MLP 下投影中最明显。 来自论文给出的概率前向误差界推导,摘要中报告了阶数与最显著位点。

softmax 处期望交叉熵变化可分解为有符号漂移、漂移曲率与 Fisher 加权方差惩罚,解释了两位点行为相反的原因。 用二阶分解把输出层损失变化拆成可解释项,指出 MLP 噪声主要是 softmax 不变的均匀 logit 平移,故 SR 方差被大幅折减,而头噪声在词表上非均匀、不被折减。 来自论文对输出 softmax 处期望交叉熵变化的二阶分解分析。

混合精度配置下按位点分配舍入规则可显著改善困惑度。 在 MLP 输出为 t=6 的混合精度配置中,MLP 用 SR、头用 RN,把困惑度带到全精度参考的 1.10 倍,较同位宽 RN 降低 28%。 DistilGPT-2 上的仿真观测,摘要报告了 1.10 倍与 28% 两个数值。

启示与展望

该结果面向低精度 Transformer 推理的数值设计者:在固定数值格式、仅改变单个运算位点舍入规则的设定下,位点级分配舍入规则是可操作的杠杆。VPSR 扩展使任意虚拟精度实验成为可能,因此后续工作可在更宽精度范围、更多模型与更多运算位点上检验这一权衡;混合精度配置(MLP 输出 t=6、MLP 用 SR、头用 RN)给出了一个可直接复现的起点。

读者仍需关注:位点级结论在更大模型、其他精度与其他运算位点上是否保持;SR 在头部的非均匀方差是否随词表规模或任务变化;混合精度配置的 1.10 倍与 28% 是在 DistilGPT-2、t=6 条件下观测到的,向其他设置外推需要新的实验。本次读取范围为摘要,正文中的图表与完整实验矩阵未纳入,因此上述数值的完整条件与消融细节仍属开放问题。

来源