跳到主要内容
返回时间线
arXiv来源发表:

ByteDance Seed与威斯康星大学把FP8强化学习全流程跑通:定位到熵激增的过裁剪成因,用Calibrated Clipping在8B到32B上追平BF16并取得最高1.5倍训练吞吐

核心概要

该工作研究大语言模型全流程FP8强化学习的训练稳定性,指出复合FP8量化噪声会扭曲重要性比值、使负优势token被过度下裁剪而梯度被错误置零,并提出Calibrated Clipping通过匹配BF16参考的下裁剪分位数并重新平衡上界来动态校准裁剪边界,在GRPO与DAPO、8B至32B模型和多种FP8缩放粒度上消除熵激增、恢复接近BF16的性能,同时训练吞吐最高可达BF16的1.5倍。

AI-generated editorial illustration: Towards Full Pipeline FP8 Reinforcement Learning for LLMs

深度剖析

论文识别出全流程FP8强化学习的一个此前被忽视的失效模式:复合量化噪声在重要性比值上被放大,导致系统性过裁剪,进而引发训练中期的熵激增与乱码输出。 此前工作主要关注rollout与训练之间的精度不匹配,并用TIS等校正手段处理;本文把问题定位到PPO式代理目标中裁剪机制本身在量化空间里被扭曲,指出即使采用统一FP8流程、缩小精度差,仍存在这一独立的不稳定来源。 以Qwen3-8B-Base在DeepScaleR上用GRPO、16K上下文的对照实验为依据,比较BF16基线与FP8 rollout配合BF16、tensorwise、rowwise、blockwise四种训练后端;用BF16影子前向测量概率与比值的NMAE,报告比值噪声被放大1.7×至2.9×,并给出裁剪比例、熵分箱与过裁剪token来源的统计。

论文提出Calibrated Clipping:先用BF16参考确定下裁剪分位数,再在FP8分布上反解出校准下界,随后求解上界使正负更新贡献比与BF16一致,并以周期性重校准控制开销。 与直接放宽下界或固定正贡献目标的思路不同,该方法从高精度参考中导出下界与目标比值,再反解上界,从而在量化空间里重建原本的信任域语义。 方法以算法形式给出,包含搜索区间、步长、平滑更新幅度与每20步更新一次等具体设置;论文报告校准下界在训练稳定后波动不大,因此可摊销额外BF16前向的开销,并在附录中给出对更新间隔与边界初始化的敏感性测试。

在GRPO与DAPO两类算法、8B至32B模型规模以及多种FP8缩放粒度上,Calibrated Clipping消除了熵激增并把性能恢复到接近BF16水平。 相比未校准的FP8训练,方法在多个设置上把明显落后的平均分拉回到与BF16基线相当,其中blockwise FP8在Qwen3-8B-Base上取得58.6对57.6的平均分,在Qwen2.5-32B上取得53.4对51.9。 GRPO实验在八个推理基准上每25步评估、取最佳平均分,训练500步;DAPO实验在AIME24上报告Avg@32,训练200步;另在Eurus编码数据集上给出TACO、APPS、Codeforces结果,并附训练指标曲线与校准边界轨迹。

全流程FP8在训练阶段带来吞吐收益:tensorwise缩放最高可达BF16训练吞吐的1.5倍,blockwise缩放也有约10%至20%的提升。 论文把效率收益从以往主要关注的FP8 rollout生成阶段,扩展到训练阶段本身,并跨8B、14B、32B与4K、8K、16K序列长度给出对比。 基于TorchAO的离线基准测量训练阶段吞吐,明确说明该基准不含周期性BF16参考前向;论文同时引用此前工作报告的FP8 rollout约30%生成加速,用以说明全流程的整体效率空间。

启示与展望

该结果面向使用PPO式代理目标(GRPO、DAPO)进行RL后训练、并希望把rollout与训练都迁移到FP8的工程与研究场景;适用对象是8B至32B规模、4K至16K序列长度的模型,方法需要能够获得BF16主权重并执行周期性前向参考。对采用序列级裁剪或批次级信任域设计的算法,论文明确把校准扩展到序列级列为未来工作。

校准依赖BF16参考前向,其开销在更大模型或更频繁重校准下如何变化,正文只给出离线吞吐基准并说明不含参考前向;论文也指出超参数未经过显式调优,敏感性测试显示不同更新间隔与初始化会带来一定分数差异。此外,CISPO与BAPO在该FP8设置下的失败结果提示,其他裁剪设计是否同样需要校准仍是开放问题;序列级裁剪的校准效果尚未验证。

来源