arXiv 2026年10月6日该工作提出 HarA,把每条采样 rollout 表示为 token 隐状态与位置的分布,用同一结果分组内所有 rollout 的 Fused Gromov-Wasserstein 重心刻画当前策略的内部推理模式,并以 rollout 到重心的 FGW 距离贡献度量推理元素的新颖性来重加权组式 RLVR 的 token 级优势;作者用锚点引导线性化把 FGW 化为可用 Sinkhorn 求解的 Wasserstein 形式,在 Qwen3-1.7B/4B/8B 与 GRPO、Dr.GRPO、DAPO 上于 MATH500、Minerva Math、AMC23、AIME24、AIME25 评测,平均成绩较 GRPO 最高提升 4.8%,并保持更高熵与更长回答。该工作提出 HarA,把每条采样 rollout 表示为 token 隐状态与位置的分布,用同一结果分组内所有 rollout 的 Fused Gromov-Wasserstein 重心刻画当前策略的内部推理模式,并以 rollout 到重心的 FGW 距离贡献度量推理元素的新颖性来重加权组式 RLVR 的 token 级优势;作者用锚点引导线性化把 FGW 化为可用 Sinkhorn 求解的 Wasserstein 形式,在 Qwen3-1.7B/4B/8B 与 GRPO、Dr.GRPO、DAPO 上于 MATH500、Minerva Math、AMC23、AIME24、AIME25 评测,平均成绩较 GRPO 最高提升 4.8%,并保持更高熵与更长回答。HarA 用 FGW 重心重加权 RLVR 优势,在 Qwen3 三个规模上把平均推理成绩最高提升 4.8%该工作提出 HarA,把每条采样 rollout 表示为 token 隐状态与位置的分布,用同一结果分组内所有 rollout 的 Fused Gromov-Wasserstein 重心刻画当前策略的内部推理模式,并以 rollout 到重心的 FGW 距离贡献度量推理元素的新颖性来重加权组式 RLVR 的 token 级优势;作者用锚点引导线性化把 FGW 化为可用 Sinkhorn 求解的 Wasserstein 形式,在 Qwen3-1.7B/4B/8B 与 GRPO、Dr.GRPO、DAPO 上于 MATH500、Minerva Math、AMC23、AIME24、AIME25 评测,平均成绩较 GRPO 最高提升 4.8%,并保持更高熵与更长回答。该工作提出 HarA,把每条采样 rollout 表示为 token 隐状态与位置的分布,用同一结果分组内所有 rollout 的 Fused Gromov-Wasserstein 重心刻画当前策略的内部推理模式,并以 rollout 到重心的 FGW 距离贡献度量推理元素的新颖性来重加权组式 RLVR 的 token 级优势;作者用锚点引导线性化把 FGW 化为可用 Sinkhorn 求解的 Wasserstein 形式,在 Qwen3-1.7B/4B/8B 与 GRPO、Dr.GRPO、DAPO 上于 MATH500、Minerva Math、AMC23、AIME24、AIME25 评测,平均成绩较 GRPO 最高提升 4.8%,并保持更高熵与更长回答。