跳到主要内容
返回时间线
Microsoft Research来源发表:

微软亚洲研究院开源 Agent Lightning v1.0:约 3,500 行代码实现 Harnessed Agentic RL,Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提升至 56.4%

相关研究与后续进展

核心概要

微软亚洲研究院提出 Harnessed Agentic RL 训练范式并开源重建 Agent Lightning v1.0,让部署所用的同一 agent harness 通过 LLM 代理直接参与强化学习,框架约 3,500 行代码、以标准 Kubernetes 作业运行 agent,并在 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 的端到端编码 agent 流水线上,仅用约 6,000 条训练样本把 SWE-bench Verified 的 Pass@1 从 41.8% 提升到 56.4%,绝对增益 14.6 个百分点。

AI-generated editorial illustration: Agent Lightning v1.0: A 3,500-Line Lightweight Agentic RL Framework for Training Agents with Real Harnesses

深度剖析

提出并形式化 Harnessed Agentic RL 范式:部署时使用的 agent harness 直接参与训练,无需在训练框架内重新实现 agent。 传统 agentic RL(如 verl、AReaL、slime)假设训练框架拥有与环境交互的循环,需在框架内重建 agent 循环;Agent Lightning 改为在 agent 与模型之间放置 LLM 代理,只需把原先调用模型 API 的端点指向 Agent Lightning,即可观察并记录模型调用,且不改动现有 harness 代码。 文中以范式定义与系统设计说明为主,并给出 Figure 1 的示意;未报告与重建式方法的对照实验数据。

以约 3,500 行代码实现完整的 agent RL 控制平面,包含 API Gateway、Rollout Controller 与 Customized Trainer 三个核心组件。 相比原有 Agent Lightning,v1.0 更强调轻量、与真实 harness 集成以及完整可复现的训练流水线;Customized Trainer 构建于 verl 之上,通过 sample adapter 组装训练样本。 以代码规模与组件架构描述为证据,并给出 Figure 2;未提供与其他框架代码规模的定量对比。

提出 Collocated Async RL,让 rollout 与模型更新共享同一组 GPU,实验中相对同步 RL 取得约 2 倍端到端加速,且所用 GPU 少于常规异步 RL。 同步 RL 需等待批次中最慢的 agent 而闲置 GPU,完全异步 RL 虽提升利用率但需为 rollout 与训练分配独立 GPU 池;该方案在收集到足够 rollout 后暂停接受新请求、等待进行中请求完成再更新,状态转换对外部 harness 透明。 以实验中的端到端加速比与 GPU 使用量对比为证据,并给出 Figure 3;未报告具体 GPU 型号、数量或多次重复的方差。

在 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B 上构建端到端编码 agent 流水线,仅用约 6,000 条训练样本,使 SWE-bench Verified 的 Pass@1 从 41.8% 升至 56.4%,并验证 rollout 级优势计算与归一化优于样本级处理。 流水线覆盖数据清洗、环境构建、reward-hacking 防护与 RL 训练,且无需大规模算力;rollout 级优势结合 rollout 级归一化相比样本级处理获得更高验证奖励,策略熵在训练中更稳定。 以 SWE-bench Verified 上的 Pass@1 前后对比与验证奖励、策略熵曲线为证据,并给出 Figure 5;未报告多次运行的置信区间或统计显著性检验。

启示与展望

该工作面向希望用真实部署 harness 做强化学习训练的 agent 开发者与研究者,尤其是编码 agent 与通用 agent 系统团队。适用设定是:已有可运行的 agent harness,只需把模型端点指向 Agent Lightning 的 OpenAI 兼容代理;执行环境可以是本地进程,也可以是自管集群、云 Kubernetes 或本地基础设施上的标准 Kubernetes 作业,不依赖付费商业沙箱服务。文中给出的端到端编码 agent 示例基于 SWE-smith、mini-SWE-agent 与 Qwen3.5-9B,训练集约 6,000 条样本,无需大规模算力。由此可继续推进的方向包括:把该范式扩展到编码之外的 harness,在更多模型与任务上复用同一控制平面,以及在自有集群上以较低成本扩大 rollout 规模。

读者仍需关注若干开放问题。其一,SWE-bench Verified 上 41.8% 到 56.4% 的提升来自单次报告的对比,文中未给出重复运行的方差或统计检验,因此增益的稳定性有待更多运行确认。其二,约 2 倍端到端加速与更少 GPU 的结论未附具体 GPU 型号、数量与并行配置,迁移到不同硬件时的表现需要自行验证。其三,rollout 级优势与归一化优于样本级的结论以验证奖励与策略熵曲线呈现,未报告多种子或不同 harness 下的复现情况。其四,retokenization 导致的 token 边界偏移、子 agent 与上下文摘要造成的样本切分,在更长上下文或更复杂 harness 下的影响程度,文中以挑战描述为主,尚缺边界条件的系统刻画。其五,本文为全文解析,但图表以引用形式出现,具体曲线数值与实验配置细节需查阅原文图表。

来源