跳到主要内容
返回时间线
arXiv来源发表:

TGRL 把温度差异变成训练信号:数学平均分提升 1.6%、CodeForces 评分提高 196.7 分,且不增加 rollout 预算

核心概要

该工作提出温度分组强化学习(TGRL),对每个提示把 rollout 组划分为低温参考子集与高温探索子集,用两组奖励差估计提示级探索增益,并用同一 logits 下温度缩放下一词分布之间的 Jensen–Shannon 散度把该增益分配为 token 级信用;在 11 个基准上,TGRL 在不扩大 rollout 预算的前提下,把 32B 六项数学平均分提高 1.6%、CodeForces 评分提高 196.7 分、LiveCodeBench Pass@16 提高 4.4%,ALFWorld/WebShop 成功率提高 6.3%/4.9%,并以最高快 36% 的速度达到与强 RLVR 基线相当的准确率。

AI-generated editorial illustration: TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

深度剖析

TGRL 把采样温度从解码参数变成显式的训练信号:每个提示的 rollout 组被拆成低温参考子集与高温探索子集,两组平均奖励之差被用作提示级探索增益的无偏估计,并以加性项注入混合组优势。 此前的 RLVR 探索手段要么在 rollout 阶段扩大采样预算(测试时扩展),要么把探索当作全局正则项、辅助目标或解码策略(温度调度),而 TGRL 首次把温度诱导的多样性转化为与可验证奖励挂钩的提示级增益估计。 论文给出 Lemma 1 的推导,说明低温组奖励与高温组奖励独立时,两组均值差是提示级探索增益的无偏估计;Proposition 1 进一步把混合组优势分解为子组内波动项与由探索增益控制的跨组偏移项,并附有合成诊断实验。

探索增益被 JS 散度按 token 分配:对同一 logits 计算低温与高温下一词分布之间的 Jensen–Shannon 散度,散度越大的位置获得越多信用,梯度更新集中在温度敏感位置。 以往方法把探索信号均匀广播到整条回复或仅作为序列级标量,TGRL 用 JS 散度给出 token 级分配准则,并证明任何单调 JS 加权都会比均匀加权把更多权重给温度敏感位置。 Lemma 2 给出 token 级 JS 被路径平均 logit 方差控制的上界,Proposition 2 给出单调 JS 加权的信用分配结论;局部降温探针显示 JS 选中的片段在降温替换后翻转率最高(12.1%)、平均分数下降最大(0.241),高于 Low-Margin(11.6%、0.232)、Matched-Random(8.7%、0.173)与 Entropy(7.6%、0.152)。

在 11 个基准上,TGRL 在不扩大 rollout 预算的情况下普遍优于强 RLVR 基线,且训练动态显示增益来自 token 级信用分配而非奖励尺度。 增益集中在需要多样推理策略的竞赛级数学、未饱和代码基准与稀疏奖励长程智能体任务上,而近饱和基准上保持竞争力,与“按提示判断探索是否有益”的设计一致。 32B 六项数学平均 70.2(最强基线 68.6),14B 为 69.4(最强基线 68.0);CodeForces 评分从 1224.0 提升到 1574.3(+196.7),LiveCodeBench Pass@16 提升 4.4%;ALFWorld 总体成功率 86.7%(较最佳 RL 基线 +6.3%),WebShop 成功率 74.2%(+4.9%);TGRL 与“均匀 token 信用”变体的后期训练奖励接近(0.394 对 0.388),但下游准确率、回复长度与截断率不同。

墙钟实验显示 TGRL 在相同算力预算下学习更快:与 GRPO 在匹配的 12 小时预算内取得更高 AIME-Combined 分数,并以约 6.39 小时达到 DAPO 约 10.01 小时才达到的准确率目标。 论文把“探索增益估计”与“每单位墙钟的学习进度”联系起来,说明混合温度 rollout 构造与 token 级 JS 后处理没有带来可见的墙钟惩罚。 复杂度分析(Proposition 4、Corollary 1)表明 TGRL 与单温度组优化同阶,额外开销仅为高温组上的低阶 token 级 JS 计算;墙钟对比在相同硬件、数据管线与解码配置下进行。

启示与展望

该结果面向具备可验证奖励的强化学习场景:数学推理、代码生成与基准化长程智能体任务,训练数据为 DeepScaleR、DeepCoder 以及 WebShop/ALFWorld 环境,主干为 Qwen3-4B/14B/32B 与 Qwen2.5-7B-Instruct。默认配置为每提示 4 条 rollout、低温 0.3 与高温 1.2 的 1:3 划分、20 步单温度预热,低温组只参与组统计而不接收 token 级梯度。作者明确表示不声称该机制直接解决开放式对话、主观偏好优化、安全关键决策或奖励噪声大、延迟或难以验证的任务。后续可沿自适应多温度分组、更丰富的 token 信用分配准则以及更开放的交互环境扩展。

竞赛级数学基准题量较小(AIME24/AIME25 各 30 题、AMC23 40 题),论文用 5 种子 Avg@16 评估报告跨种子标准差通常为 1–4 个百分点,并称 AIME 上的平均差距大于单种子标准差;读者仍可关注不同主干、不同奖励验证器与更长训练步数下的表现。温度敏感性实验显示性能只在温度差过窄时明显下降,较大温度差区间内保持竞争,但最优温度仍随任务与检查点变化。论文的局限章节指出该机制未覆盖开放式对话、主观偏好、安全关键决策与噪声或延迟奖励场景。此外,首页证据包中的外部报道与论文正文在部分数值上存在排版缺失(如“up to faster”“by points”处数字空缺),本总结中的具体数值以论文正文与表格中可读到的数字为准。

来源