HarA 用 FGW 重心重加权 RLVR 优势,在 Qwen3 三个规模上把平均推理成绩最高提升 4.8%
相关研究与后续进展核心概要
该工作提出 HarA,把每条采样 rollout 表示为 token 隐状态与位置的分布,用同一结果分组内所有 rollout 的 Fused Gromov-Wasserstein 重心刻画当前策略的内部推理模式,并以 rollout 到重心的 FGW 距离贡献度量推理元素的新颖性来重加权组式 RLVR 的 token 级优势;作者用锚点引导线性化把 FGW 化为可用 Sinkhorn 求解的 Wasserstein 形式,在 Qwen3-1.7B/4B/8B 与 GRPO、Dr.GRPO、DAPO 上于 MATH500、Minerva Math、AMC23、AIME24、AIME25 评测,平均成绩较 GRPO 最高提升 4.8%,并保持更高熵与更长回答。
Figure 1: An example comparing existing credit assignment methods and the proposed HarA .
arXiv深度剖析
HarA 用 FGW 重心表示当前策略的内部推理模式,并据此定义推理元素的新颖性。 既有 GRPO 信用分配依赖 rollout 内部的局部信号(token 位置或熵),HarA 改为把 rollout 投影为隐状态与位置上的分布,与同结果分组内所有 rollout 的 FGW 重心比较,从而给出相对当前策略的全局新颖性。 论文给出 FGW 距离与 FGW 重心的形式化定义,并在 MATH500 上做可解释性研究:重心支撑与 LLM 导出的推理阶段之间的映射呈稀疏块对角,且 FGW 的平均似然分数高于 Wasserstein 与 Gromov-Wasserstein 变体,并随采样数增加单调提升。
锚点引导线性化把昂贵的 FGW 问题化为可用 Sinkhorn 高效求解的 Wasserstein 问题,并给出误差界与复杂度。 原始 FGW 含四次、非凸的 GW 项;作者固定第二个传输计划以预对齐每条 rollout 的首尾 token 作为推理锚点,使问题变为凸的 Wasserstein 形式。 论文给出引理 3.1 的线性化推导、定理 3.2 的近似误差上界(由传输计划中逆序项幅度决定)与定理 3.3 的复杂度结论:时间与空间复杂度随 rollout 长度线性增长;消融显示线性化使每步训练时间从 154 降至 41.0(seq)、175 降至 43.6(tok),准确率变化小于 1%。
按新颖性重加权 token 级优势后,HarA 在多个模型、基准与组式 RLVR 方法上稳定优于现有信用分配方法。 HarA 是即插即用框架,可作用于 GRPO、Dr.GRPO、DAPO,并支持序列级与 token 级两种粒度;token 级变体在多数数据集与模型上优于序列级。 在 3 个模型规模、5 个数学推理基准、3 种组式 RLVR 方法上评测,平均成绩较 GRPO 最高提升 4.8%,较信用分配基线最高提升 4.0%;附录中 Dr.GRPO 与 DAPO 结果同样显示一致提升。
HarA 改变训练动态:收敛更快、最终成绩更高,并维持更高熵与更长回答。 既有方法常被报告出现熵塌缩;HarA 通过强调新颖推理行为来保持探索。 论文在 Qwen3-8B-Base 与 MATH500 上追踪准确率、回答长度与熵三条曲线,报告 HarA 收敛更快、最终成绩更好、熵高于 GRPO 且回答更长;效率上额外训练时间最高 13.6%,相同准确率下最高 2.64 倍加速,相同训练时间下准确率提升 8.7%。
启示与展望
该结果面向使用组式 RLVR 做 LLM 后训练的研究者与工程团队,适用场景是同一提示下按可验证结果分组、每组采样多条 rollout 的设定;训练数据为 MATH 的 12,000 道题,评测集中在五个数学推理基准与 Qwen3-1.7B/4B/8B 三个规模。方法以即插即用方式接入 GRPO、Dr.GRPO、DAPO,支持序列级与 token 级两种粒度,并给出线性化的误差界与线性复杂度,因此可直接用于标准 RLVR 训练流程,也可作为把最优传输度量引入其他优势重加权方案的起点。
FGW 重心作为“内部推理模式”的解读依赖隐状态编码抽象推理步骤这一前提,其可解释性研究在 MATH500 上借助外部 LLM 划分推理阶段,映射质量与提示设计相关;新颖性度量与优势重加权的具体形式、以及式 (7)、式 (8) 的完整表达式在正文中受排版影响,读者需对照附录确认细节。此外,评测集中于数学推理与 Qwen3 系列,其他任务族、其他模型家族与更长回答设定下的表现仍待观察;重心大小、FGW 权衡参数与熵正则系数的敏感性只在附录中部分展开。
