HDL 用「事后分歧」定位分支点:生成 token 减少 35–61%,智能体任务最高提升 12.46 分
核心概要
该工作提出 Hindsight-Divergence Localization(HDL),用加入验证器反馈与反思后 token 对数似然的变化幅度来挑选轨迹中的分支点,只生成少量完整根轨迹、其余槽位用复用前缀的续写填充,在数学、代码与智能体三类任务、三个模型上相对 GRPO 减少 35–61% 生成 token、缩短 18–45% rollout 墙钟时间,同时提升任务表现,智能体任务最高提升 12.46 个百分点。
深度剖析
HDL 把「模型在得知结果后改变主意的地方」变成可计算的分数:给定完整根轨迹与验证器反馈,策略先生成一段反思,再分别在原始上下文与含反馈和反思的事后上下文下对已采样 token 重新打分,用两者对数似然的绝对差作为 hindsight-divergence 分数,取分数最高的位置作为分支点。 此前的分支方法用策略熵(TreeRL、BPO)或让模型显式指出重试点(PivoARL、R3L)来选位置;HDL 不依赖显式错误定位,而是用事后似然变化排序,且事后信息只用于选点,不进入监督信号。 论文给出打分公式与代码生成示例:根轨迹的素性判断错误接受了一个数,反馈促使反思指出缺少守卫条件,最大似然变化正落在 for 处;在 Qwen3-8B 上 HDL 在三类任务得分均高于 Entropy 与 Reflection 两种定位信号,智能体任务上分别高出 5.67 与 6.54 个百分点。
训练组由少量完整根轨迹加分支续写构成:每个续写复用根前缀、在原始任务上下文下重新采样后缀,损失只作用于新生成的后缀,从而在不改变组大小与 GRPO 目标的前提下降低生成成本。 异步 RL 系统与部分 rollout 提升的是吞吐,未改变「独立采样完整轨迹」这一采样单元;token 选择类方法只在生成完整轨迹后挑 token 更新,不减少生成量。HDL 在生成阶段就把预算挪到分支续写上。 默认配置为每问题 2 条根轨迹、每条选 2 个分支点、分别分配 3 与 4 条续写,共 12 条轨迹;相对 GRPO 生成 token 减少 35–61%,相对 DAPO 减少 43–75%,rollout 墙钟时间相对 GRPO 缩短 18–45%、相对 DAPO 缩短 34–69%,且 token 统计已包含 HDL 的反思生成与 DAPO 丢弃的候选。
在匹配组大小与训练步数下,HDL 在数学、代码、智能体三类任务上均优于 GRPO,智能体任务收益最大。 该结果说明把探索集中到事后被重新考虑的决定上,可以在更少生成预算下取得更好表现,而不仅是省算力。 三个模型(Qwen3-4B、Qwen3-8B、Llama3.1-8B)在 AIME24/25/26、HMMT、Minerva、OlympiadBench、LiveCodeBench v5/v6 与 ScienceWorld 上评测,每 10 步评测一次并取各域平均分最高的三个检查点;Qwen3-8B 数学平均 54.16% 高于 GRPO 53.17% 与 DAPO 53.47%,代码上 Qwen3-4B 54.15%、Qwen3-8B 55.56% 为最高,智能体上 Qwen3-4B 由 57.76% 升至 67.44%、Qwen3-8B 由 59.50% 升至 71.96%。
分支配置与定位信号存在可比较的取舍:默认的「2 根 × 2 点」在 Qwen3-8B 智能体上得分最高(71.96%),减少到每根 1 个分支点可再省 15% rollout 时间但得分下降 0.87 分,增加到 4 条根轨迹则生成更多 token 且得分低 4.09 分。 这把「在哪里分支、分几支」从设计直觉变成可测量的配置选择,并显示在每个根内重访多个位置、每个位置保留多条续写更有利。 三组配置在相同组大小下对比,报告了得分、生成 token 量与 rollout 时间;Reflection 基线平均只得到 3.95 上限中的 3.22 个有效分支点,部分返回的位置无法解析或过于接近。
启示与展望
该方法面向有可验证奖励、能提供反馈的任务设定,论文在数学(DeepMath-103K 过滤后 4,555 题)、代码(DeepCoder 与 rStar-Coder 合并过滤后 4,063 题)与智能体(ScienceWorld 1,856 个任务–变体对、每回合限 30 个动作)三类环境、Qwen3-4B、Qwen3-8B、Llama3.1-8B 三个模型上验证,训练用 slime 框架、四节点各四块 GB200。它适用于希望在不改变组大小与 GRPO 目标的前提下压缩 rollout 生成成本的团队,尤其是长程交互任务;下一步可检验的是在更大模型、更多可验证领域以及不同反馈粒度下,事后分歧是否仍是有效的选点依据。
证据包中的正文表格(数学、代码、智能体分项成绩,定位信号对比,分支配置对比)数值为空,因此只能引用正文叙述中的汇总数字,无法逐项核对各基准得分与标准差。附录指出 HDL 依赖策略能可靠解读反馈:Qwen3-8B 的结果判定与验证器一致率为 99.7–99.9%,而 Qwen3-1.7B 在数学与代码上降至 76.0% 与 56.1%,其智能体表现与 GRPO 持平(45.70% 对 45.66%)并低于 Entropy(47.54%)。因此事后重打分在弱模型上是否引入噪声、反思生成与事后打分的开销在不同规模下如何变化,仍是值得继续观察的问题。
