跳到主要内容
返回时间线
arXiv来源发表:

QwenGyre 用弹性 GPU 调度与轨迹树处理,让 Qwen 3.8 2.4T 在 NL2RepoBench 上 48 步从 52.5% 提升到 58.5%

核心概要

QwenGyre 是一个面向超长时程(xLong)智能体在线强化学习的端到端框架,它通过弹性调度器在不中断正在运行的 harness 执行的前提下于 rollout 与训练之间重新分配 GPU,并用轨迹处理器把分支执行记录重建为共享前缀的轨迹树、对超时后的部分进展打分、按角色优先级去重采样轨迹,在 Qwen 3.8 2.4T 上以每次 rollout 70 万 token 训练 48 步,使 NL2RepoBench 通过率从 52.5% 提升到 58.5%,并在多个数据集上相对 Colocate 与 Async 取得最高 1.85 倍和 1.78 倍的端到端加速。

AI-generated editorial illustration: QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents

深度剖析

论文指出 xLong 智能体在线 RL 存在两类结构性难题:一是执行时长差异极大、rollout 延迟长,导致 GPU 大量空转;二是复杂非线性分支产生海量轨迹冗余,拖垮训练效率。 此前工作分别处理调度或轨迹捕获中的单一问题,而该文把调度与轨迹处理作为同一 xLong 场景下必须同时解决的两个挑战提出。 基于对 xLong 执行画像的刻画:单次执行可持续数小时、包含数百次模型—环境交互、跨模型调用处理约 100 万 token;并给出 NL2RepoBench 上 Qwen 3.6 122B 平均每次 rollout 执行 1.93 小时、每个 query 2.96 小时、9.51% 的 query 至少 4 小时等实测分布。

QwenGyre 的弹性调度器按未完成 rollout 工作量在 rollout 与训练之间动态调整 GPU 分配,并保证正在运行的 harness 执行仍能获得推理服务;新加入的节点可以加入正在进行的训练批次,流式训练按各数据并行组的进度分发工作。 与固定划分 GPU 池的 Async 和整池切换的 Colocate 不同,该设计让 harness 状态跨 GPU 角色变化持续存在,并允许训练在 rollout 尾部结束前就开始。 在 32 节点、8 个 4 节点 cell 的配置下,E0 相对 C2 取得加速,且 rollout 完全掩盖训练、剩余 20.85% 余量;角色切换平均耗时 8.52 秒(rollout 转训练)与 3.46 秒(训练转 rollout),相对数小时的执行可忽略。

轨迹处理器用 token-in、token-out 记录每次模型调用的精确输入输出 token 与行为 log 概率,组织成共享前缀的轨迹树,保留每个输出原始的 conditioning 上下文;评估器对执行终止后保留的工作区打分,包括超时后可评估的部分进展;训练时按角色优先级为每次执行选取至多固定数量的轨迹,共享目标只计一次,并在执行内对 token 损失取平均。 该设计把角色、分支、环境状态与评估器来源贯穿 rollout 采集、准入与训练物化全过程,而不是只做轨迹捕获、信用分配或前缀计算中的某一项。 案例研究给出一次执行含 636 次代理请求、1,347 个唯一消息节点、10 条候选轨迹;独立展开产生 1,716 个节点出现次数,而共享节点为 1,347,多出的 369 次重复来自共享前缀与系统提示。消融显示只采样主轨迹会带来更低训练分数与更大梯度范数,上限设为 5 条时分数与采样全部轨迹相当,同时前向—反向时间比不设上限减少 25.2%。

在 Qwen 3.8 2.4T 上以每次 rollout 70 万 token 训练 48 步,NL2RepoBench 通过率从约 52.5% 提升到 58.5%;在等 GPU 预算与匹配调度陈旧度下,QwenGyre 相对 Async 与 Colocate 取得最高 1.85 倍和 1.78 倍端到端加速,且训练分数与基线相当。 该结果把弹性调度与轨迹处理同时扩展到旗舰规模模型与 xLong 训练负载,而不只是中小规模配置。 Qwen 3.8 2.4T 的 NL2RepoBench 训练 48 步耗时 75.42 小时,Async 为 134.55 小时、Colocate 为 91.47 小时;DeepSWE 与 TerminalBench 在 Qwen 3.6 122B、24 步、两个陈旧度目标下均报告了一致的加速。

启示与展望

该框架面向通过未修改黑盒 harness 执行、单次持续数小时、跨数百次交互、约 100 万 token 的 xLong 在线 RL 场景,适用于具备多个可独立切换 cell 且能维持足够 rollout 容量的 GPU 部署;在等预算下,8 个 4 节点 cell 与 4 个 8 节点 cell 的差异仅 2.2%,说明中等 cell 数量即可保留大部分重叠收益。对使用方而言,这意味着可以在保持 harness 与工作区状态的前提下,把空闲 GPU 从 rollout 转入训练,并在超时后仍利用可评估的部分进展。

仍待观察的问题包括:在显著更小的总 GPU 预算下弹性组织的效率尚未评估;多步 burst 的流式训练无法在 burst 开始前对全部 minibatch 做全局打乱,样本顺序对学习质量的影响未被单独分离;附录中的深度与时间比较依赖 ready-rate 近似,且计数恒等式针对按组加权的平均陈旧度,最坏情况与按 token 加权的保证需要另行分析;案例研究未给出指定的任务奖励,因此该次执行的可训练性只能按规则推演。

来源