跳到主要内容
返回时间线
arXiv来源发表:

MILO 用多智能体协同进化自动发现智能体 harness,在 Terminal-Bench 2.1 上以 86.1% 超过官方榜首并收紧三个数学上界

核心概要

MILO(Meta-evolutionary Island Orchestration)把智能体 harness 与其搜索策略共同进化:用岛屿式层级谱系记忆把被拒绝的变异当作负证据,用每个岛屿的 mutator 智能体重写完整 harness,再由 orchestrator 智能体通过谱系嫁接、物种分化、mutator 重分配与课程修订自适应调整搜索;在 Terminal-Bench 2.1、PaperBench、DeepSWE 上,用 Opus 4.8 相对初始 harness 分别提升 12.0%、28.3%、10.3%(此前最佳搜索增益为 4.5%、18.3%、0%),Terminal-Bench 2.1 达到 86.1±2.0%(

AI-generated editorial illustration: MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution

深度剖析

MILO 把 harness 发现建模为策略级进化搜索,并让搜索策略本身随进度自我改写:岛屿式层级谱系记忆保留每个 seed 到候选的路径(含被拒绝的候选),mutator 智能体结合全局搜索历史与父代弱点反馈重写整个 harness,orchestrator 在停滞时执行 Graft、Speciate、Reassign、Curriculum 四类干预。 此前方法或只优化 prompt/skill(GEPA、A-Evolve),或虽重写整个 harness 却沿用固定的、偏利用的 LLM mutator(Self-Harness、Meta-Harness),且大多只保留幸存者(单一候选、Pareto 前沿或 MAP-Elites 单元),失败方向容易被重复尝试。 论文给出三组件的形式化描述(层级谱系记忆、证据驱动 mutator、元进化 orchestrator)与消融阶梯(平坦记忆 LLM mutator → mutator 智能体 → 谱系记忆 → 多岛屿 → orchestrator),并说明每个机制逐项加入的差异;具体消融数值在正文表格中未完整呈现。

在三个长时程基准上,MILO 发现的 harness 同时超过八个最先进 harness 与六种搜索方法,并在准确率提升的同时降低推理成本。 论文报告用 Opus 4.8 时相对初始 harness 的 resolution rate 提升为 +12.0%、+28.3%、+10.3%,而最佳先前搜索增益为 +4.5%、+18.3%、0%;Terminal-Bench 2.1 上达到 86.1±2.0%,高于官方榜首 83.8±2.3%,且比初始 harness 少用 26% token。 所有搜索方法共享同一 72 小时墙钟预算、同一三个专家设计种子(B10–B12)与同一评分器;误差为按任务聚类的 95% 置信区间,PaperBench 使用 GPT-5.5 评审的官方复现评分。正文表格中的多数单元格在本次加载的文本中为空,因此逐项数值只能依据摘要与正文叙述。

MILO 的 harness 具备跨基准与跨骨干的迁移性,并能在不重新搜索的情况下泛化到更难的 Frontier-Bench。 论文强调 harness 增益未必跨骨干迁移:在 TB2.1 上八个最先进 harness 用 Opus 4.8 时全部优于最小 harness,但换用 gpt-oss-120b 后其中四个反而更差;MILO 在两种骨干上均报告增益。 迁移证据来自在 Frontier-Bench 上不进行额外搜索的评测,以及 gpt-oss-120b 与 Opus 4.8 两种骨干的对比;论文同时给出一个具体反例:Mini-SWE-Agent 在 TB2.1 上用掉接近 Goose 的 token 却只得到相近的 RR@5(73.9% 对 74.5%)。

在实例级科学发现任务上,MILO 进化的 harness 收紧三个开放数学问题的最佳已知上界。 论文报告 Erdős 最小重叠从 0.3808586 改进到 0.3808568,第一自相关不等式从 1.50274365 改进到 1.50274360,第三自相关不等式从 1.45081 改进到 1.44889,均低于此前最佳(含 AlphaEvolve、TTT-Discover、EvoX 与竞技场领先条目)。 该实验让智能体编辑优化器程序,每个任务配一个起始构造、父代优化器、种子与 60 秒运行预算,harness 适应度为 30 任务库上的平均增益,并由可信子进程重新评分;论文说明只有第一自相关不等式的 AlphaEvolve 最终程序公开,其余问题只能做构造层面的比较。

启示与展望

这项工作面向需要长时程自主执行的智能体开发者与研究者:给定一个可运行、源码可编辑的 build_agent 入口,MILO 就能在 72 小时墙钟预算内为其发现更强的 harness,适用于命令行任务、论文复现、多文件软件工程,以及需要编辑优化器程序的开放数学问题。论文明确其 harness 空间实例化为 DeepAgents 框架,但方法只要求可运行的构建入口与可编辑源码,因此原则上可迁移到 OpenHands 或 Mini-SWE-Agent 等交互方案;同时论文提出可扩展到偏好优化算法与设计启发式等其他求解器家族,以及把自动 harness 发现用于编写解程序的智能体这一实例级扩展。

本次加载的正文中,多个结果表格的数值单元格为空,因此除摘要与正文叙述明确给出的数字外,逐项基准分数、消融各档的具体增益、以及各基线的最佳 harness 细节无法从文本中核对;此外,论文报告的是单次 72 小时搜索预算下的最佳候选,不同骨干与基准上的稳定性、以及数学上界改进在更大问题集上的可复现性,仍是读者可以继续观察的方向。

来源