ANTMAN 用可修订的 Need Graph 取代静态分区:搜索空间扩大 16 倍时活跃协调只增 1.23 倍,而分区式基线超过 15 倍
核心概要
该工作提出 ANTMAN,一个以“尚未解决的信息需求”而非输入分区作为运行时协调单位的多智能体信息检索框架,它维护可修订的 Need Graph 来跟踪未解决需求、已积累证据、既往尝试与搜索进度,并据此控制 worker 选择、路由与任务内恢复;在多文档问答、受控长上下文扩展与结构化导航三类实验中,ANTMAN 在搜索空间扩大 16 倍时活跃协调仅增加 1.23 倍(分区驱动基线超过 15 倍),同时保持较强答案质量,并在把执行交给更小的 8B worker 模型时仍保留大部分性能。
深度剖析
ANTMAN 把“不断演化的未解决信息需求”作为运行时协调单位,用可修订的 Need Graph 记录未解决需求、已积累证据、既往尝试与搜索进度,并据此决定激活哪些 worker、如何路由以及何时做任务内恢复。 既有长上下文多智能体系统多按输入分区分配 worker,例如 LongAgent 把输入切成固定大小块并各配一个成员智能体,使智能体规模随分区数增长;ANTMAN 把协调状态从“空间如何被切分”改为“查询还缺什么”。 论文给出形式化刻画:每个协调步最多激活一个 territory-backed worker,且每个已实现需求的路由次数受上限约束,因此激活 worker 数受任务需求与单需求路由预算约束,而不直接由可用 territory 总数决定;附录 A 给出该命题与证明。
在受控信息空间扩展实验中,搜索空间从 32K 增至 512K(16 倍)时,ANTMAN 的活跃协调只增长 1.23 倍,而 LongAgent 与 CoA 分别增长 15.29 倍与 15.33 倍,模型调用与推理成本也呈现同样的差距。 这一结果直接检验了“协调不应随信息空间规模增长”的设计主张,把空间规模与信息需求近似固定地分离开来。 实验沿用 LongAgent 的 Needle-in-a-Haystack PLUS 多针设置,10 个问题、Early/Middle/Late 三种证据位置、32K/64K/128K/512K 四种长度,每个条目平均 30 次评估;附录 B 给出端点增长与逐长度完整结果。
同一套需求条件化协调机制无需针对底层重做即可迁移到不同信息基底:在 RepoProbe 上比最强非基准专用基线高 15.3%,在 SWE-QA-Pro 上高 18.4%,在 GAIA 上高 27.9%;把非编排组件全部换成 Qwen3-8B 的 ANTMAN-H 仍分别保留完整 ANTMAN 性能的 89.2%、93.5% 与 98.3%。 论文把“自适应信息获取”与“自适应多智能体协调”两类既有工作通过未解决需求的表示连接起来,并说明这种连接不依赖特定基底的导航机制。 RepoProbe-Python 含 108 个问题、覆盖 8 个大型 Python 仓库,SWE-QA-Pro 使用冻结的 80 题子集,GAIA 使用固定的纯文本 GAIA-Text-103 子集;同一仓库基准内各方法使用相同冻结题集与模型设置,GAIA 上各方法共享同一工具接口。
消融显示显式且可演化的需求状态本身带来增益:在 512K 条件下,去掉显式 Need Graph 的 Graph-free Adaptive 得分为 64.01,而完整 ANTMAN 为 84.03;在 GAIA 上分别为 50.00 与 60.00,且两者激活的 worker 数量相近。 这说明收益不只是“多叫了几个 worker”或泛化的自适应重规划,而来自持续跟踪未解决需求;此外恢复机制在受控扩展中影响显著,自适应重路由在仓库导航中作用明显。 所有变体共享相同的 territory、WorkerCard、模型、工具、执行预算与综合流程,并接受相同的每查询 100 次 LLM 调用上限;附录 D 报告了答案质量、活跃协调、成本与调用数的完整对照。
启示与展望
该结果面向需要在远大于单次上下文的信息空间中定位并整合证据的检索型任务,例如多文档问答、长上下文语料、代码仓库导航与工具型网页检索;其适用前提是信息空间可被确定性地划分为 territory 并配有轻量 WorkerCard,且每个未解决需求可在局部范围内由单个 worker 有界搜索。对使用者而言,这意味着可以在不随语料增长而扩充智能体队伍的前提下扩展可搜索空间,也可以在编排器保持较强、执行侧换成 8B 级小模型时维持大部分性能。论文把该机制定位为可跨基底复用:受控长上下文与仓库评估共享同一套本地信息访问实现,仓库场景额外支持符号、导入、引用、继承与调用关系的结构导航,GAIA 则使用网页搜索、网页文本抽取与隔离 Python 执行,且各方法共享同一工具接口。
受控空间扩展中,ANTMAN 的成本增长为 6.90 倍,高于其 1.23 倍的协调增长与 1.21 倍的调用增长,说明成本与协调并非同步变化,这一差异值得进一步观察。需求扩展实验显示,在 1 个必需证据单元时 5.0 次 worker 活动中有 4.1 次与所需证据无关(占 82%),低需求下存在探索性开销,作者以轨迹分解解释而非视为失败。GAIA 上大部分差距来自 Level 3,ANTMAN-H 在较易任务上接近完整版,说明小模型替代的代价集中在更难案例。此外,GAIA 使用单一 territory-backed worker,因此重路由在该设置下不产生影响。论文展望中提出扩展到更丰富的信息基底、发展更可迁移的信息需求表示,以及细化需求修订与路由策略,这些方向目前仍是开放问题。
