跳到主要内容
返回时间线
arXiv来源发表:

蚂蚁集团提出 Marathoner:用 GitHub 百万行级 PR 合成任务,让 9B 开源模型连续工作 10 小时以上、完成 1000+ 次工具调用

核心概要

该工作提出 Marathoner,一个通过超长时程任务合成、拒绝采样微调与强化学习后训练流程训练出的自主智能体模型,在 5 个超长时程基准上相对基座 Qwen3.5-9B 取得一致且明显的提升,并在部分基准上超过强闭源模型,分析显示其可在高难度任务上持续执行 10 小时以上、发起 1000+ 次工具调用。

AI-generated editorial illustration: Marathoner: Ultra-Long-Horizon Autonomous Intelligence

深度剖析

提出一套面向超长时程执行能力的完整后训练流程,包含超长时程任务合成、拒绝采样微调与强化学习三个阶段。 此前具备超长时程执行能力的多为闭源模型,其训练方法与实现细节很少公开;该工作把这一能力以可复现的流程形式落到开源基座模型上。 论文给出完整流程描述与实现细节,包括数据规模、训练超参、框架与硬件配置,并在 5 个基准上给出对比结果。

以 GitHub 主要发布 PR 为来源合成任务级数据,并引入 Multi-Task Chaining 把多个任务串联成更高难度的 Frontier 任务。 任务难度按新增代码行数分层(Easy 100-200 行、Medium 200-1000 行、Hard 1000+ 行),比例 2:3:5;串联 5 个原子任务可生成需要跨多个大型仓库协调的任务。 论文说明收集 10,000 个 GitHub 仓库、挖掘 100,000 个主要发布 PR,并用 15,000 个任务串联出 3,000 个高难度任务;消融显示串联 5 个任务时表现最好。

提出 Later Stage Bonus Reward,在强化学习中显式奖励执行后段的有价值操作。 该奖励针对超长时程执行中后段容易失去有效进展的问题,用 LLM 将轨迹划分为阶段并判断后段是否包含关键操作,若包含则额外给 0.5 奖励。 消融显示奖励值 0.5、覆盖执行 50%-100% 区段时效果最好;奖励过小或过大都会降低表现。

Marathoner-9B 在 5 个超长时程基准上相对基座模型取得一致提升,并在部分基准上超过强闭源模型。 基座 Qwen3.5-9B 在 FrontierSWE 为 10.2、SWE-Marathon 为 0,Marathoner-9B 分别达到 26.4 与 8.2;在 FrontierSWE 与 SWE-Marathon 上超过 Gemini-3.1-Pro。 结果来自 5 个基准的对比表,且论文强调该能力由统一训练流程获得,未针对特定基准做优化。

启示与展望

该结果面向需要长时间持续执行的软件工程类任务,适用于具备沙箱环境与可验证单元测试的场景;对希望构建开源超长时程智能体的研究者与工程团队,它提供了一条以 GitHub PR 为任务来源、以单元测试为奖励验证、以多 harness 沙箱为执行环境的具体路径。论文中的执行时程统计(FrontierSWE 平均 3.56 小时、426.2 步、648.3 次工具调用)与案例中 11.8 小时、872 步、1273 次工具调用的记录,说明该能力在受控沙箱内可被观测和度量。

论文报告的是 5 个基准上的结果,其中 SWE-Marathon 与 FrontierSWE 任务数量较少(分别为 20 与 17),单点差异的稳定性仍需更多任务验证;Later Stage Bonus Reward 依赖 LLM 对轨迹分阶段并判断价值,其判断一致性在文本中未展开;此外,超长时程执行在开放环境中的安全与可控性,论文仅在引言中提及闭源模型的相关风险,未给出针对本模型的评估。

来源