AgentEvolver 在固定基础模型下让智能体于任务执行中自我演化,在 SWE-bench Pro Public 上报告 82.08% 解决率
核心概要
作者提出 AgentEvolver,一个在保持基础模型不变的前提下于任务执行过程中发展能力的系统:八类实体通过统一的版本化生命周期接受修订,共享 Runtime 协调工作,持久规划与可恢复上下文保留任务方向与证据;在 SWE-bench Pro Public 上报告 82.08% 解决率,高于其报告的无演化基线,并在六个应用案例中观察到能力被保留并进入后续网站、游戏与研究工作,同时也记录了未完成目标与一次不成功的策略。
Figure 1: Task-driven capability evolution. An observatory repair motivates complementary changes across eight entity families. Dependencies between branches lead to shared evaluation, collaborative delivery, and retained capabilities. Plan preserves the goal while Runtime coordinates the work. The scene is a conceptual analogy; revised objects and edges describe this illustrative task rather than a robotics experiment.
arXiv · 第 2 页深度剖析
系统把可复用组件(操作、方法、智能体、控制流、接口与支撑状态)纳入统一的版本化生命周期,使任务执行中产生的改动可以被评估并再次使用。 相对于只关注最终任务是否完成的智能体工作,这里把“组件被改进”与“最终任务成功”区分开来,强调改动必须连接到评估与后续使用。 以八类实体的版本化生命周期与共享 Runtime 的系统设计为支撑,属于系统层面的构造性证据。
在 SWE-bench Pro Public 上,团队报告启用演化后解决率为 82.08%,高于其报告的无演化基线。 给出了任务结果层面的量化对照,说明演化机制与任务表现之间存在可观察的差异。 单一基准上的报告数值,文本未给出样本量、重复次数或统计检验细节。
六个应用案例显示被保留的能力进入后续的网站、游戏与研究工作,同时也记录了未完成目标与一次不成功的策略。 把评估从单次任务结果扩展到能力在后续工作中的复用,并同时呈现成功与不成功的案例。 案例研究形式的定性证据,覆盖多个应用方向,但文本未说明案例的选取标准与规模。
启示与展望
该工作面向在基础模型固定条件下研究能力积累的读者,适用于把任务执行视为能力发展过程而非一次性求解的场景。八类实体的版本化生命周期与共享 Runtime 为在网站、游戏与研究等后续工作中复用已保留能力提供了可操作的框架,也为把“组件改进”与“最终任务成功”分开评估提供了具体基础。
文本为摘要级,未给出 SWE-bench Pro Public 的样本量、重复次数与统计检验,也未说明六个案例的选取标准与规模,因此 82.08% 与基线差距的稳健性仍需查看原文细节。作者明确指出独立任务迁移与总体开发成本仍是开放问题,读者在评估长期可用性时应把这两点作为观察方向。
