FastRL 以优势感知剪枝与自适应采样为 GRPO 类方法带来约 2.07 倍训练加速并提升约 1.64% 平均准确率
核心概要
该工作提出 FastRL,一个可即插即用的强化学习框架,通过优势感知剪枝策略选择性保留高优势轨迹并最大化轨迹间梯度多样性,以及基于历史剪枝分布动态调整采样规模的自适应 rollout 采样机制,在 Geometry3K 与 GeoQA8K-R1V 上实现平均 2.07 倍训练加速,并在视觉推理基准上取得约 1.64% 的平均准确率提升,且可无缝集成到 GRPO、DAPO 与 GSPO 变体中。
Figure 3: Training efficiency and parameter sensitivity of FastRL on Geometry3K (top) and GeoQA8K-R1V (bottom). (a1)-(a2) show the the rollout sampling scale G t G_{t} ; (b1)-(b2) present the number of trajectories used for policy updates; (c1)-(c2) show the sensitivity to the hyperparameter τ \tau .
arXiv深度剖析
提出优势感知剪枝策略,选择性保留高优势轨迹,同时最大化轨迹间梯度多样性。 针对低信息或高度同质轨迹会降低下游学习信号效率的问题,该策略在保留高优势轨迹的同时兼顾梯度多样性,而非仅按单一优势指标筛选。 摘要层面描述了该策略的设计目标与作用机制,具体剪枝准则与多样性度量细节未在摘要中给出。
设计自适应 rollout 采样机制,依据历史剪枝分布在不同训练阶段动态调整采样规模。 针对每问题多 rollout 采样带来的计算开销,该机制以历史剪枝分布为信号调节采样规模,在探索充分性与计算效率之间取得平衡。 摘要层面说明了机制依据与目标,具体调整规则与阈值未在摘要中给出。
FastRL 可无缝集成到 GRPO、DAPO 与 GSPO 变体中,在 Geometry3K 与 GeoQA8K-R1V 上实现平均 2.07 倍训练加速,并在视觉推理基准上取得约 1.64% 的平均准确率提升。 相对原始 GRPO 及其变体,该框架同时改善训练效率与策略学习效果,而非仅优化其中一项。 摘要报告了跨多个变体与数据集的平均加速比与平均准确率提升数值,具体实验配置与统计细节未在摘要中展开。
启示与展望
该工作面向使用 GRPO、DAPO、GSPO 等组相对策略优化方法进行策略训练的研究者与工程实践者,适用于需要每问题多 rollout 采样且关注训练开销与学习信号效率的设定。摘要所述结果在 Geometry3K 与 GeoQA8K-R1V 以及视觉推理基准上取得,并验证了与三种 GRPO 变体的集成;其即插即用定位意味着可在既有训练流程中替换或叠加使用。
摘要未给出优势感知剪枝的具体准则、梯度多样性的度量方式、自适应采样规模的调整规则与阈值,也未说明实验的模型规模、训练步数与统计显著性。读者若关注这些实现细节与结果稳健性,需要查阅正文;此外,摘要提到源代码将发布,实际可用性有待确认。
