跳到主要内容
返回时间线
arXiv来源发表:

DAGent 用“先评估再生长”的增量 DAG 规划,在 BrowseComp-Plus、GAIA 与 xbench-DeepSearch 上比最强开源基线高出 5.3/5.8/2.0 分

核心概要

DAGent 提出 Evaluate-then-Grow 增量规划:由 Orchestrator 依据已完成节点回报的置信度与不确定性信号,一次一批地生长任务 DAG,并配合分层上下文层(默认传播紧凑 QueryDoc、按需回取完整执行轨迹)与 DAG 条件化强化学习 DAGRPO(拓扑条件信用分配加结构合规正则),在 BrowseComp-Plus、GAIA、xbench-DeepSearch 上于 Qwen3-235B-A22B 规模超过最强开源基线 5.3/5.8/2.0 分,在 Qwen3-8B 规模上比同预算的纯结果 GRPO 基线平均 Pass@1 高 3.0 分,并在同架构对比中以更低的每任务 token、工具调用与步数取得更高

AI-generated editorial illustration: DAGent: Evaluate-then-Grow Planning for Deep Research Agents

深度剖析

提出 Evaluate-then-Grow 增量规划范式:任务 DAG 初始为空,Orchestrator 每次只扩展一批节点,扩展决策以已完成节点输出的结构化 QueryDoc(答案、解释、关键步骤、置信度、不确定性)为依据,节点状态被判定为 Success、Uncertain 或 Not Found,后两者触发 refine 节点,每条线最多三次尝试(一次初始执行加两次精化),终止时调度一个单独成批的 answer 型节点。 此前的 DAG 深度研究系统(Flash-Searcher 一次分解调用产出完整计划后周期性更新,FlowSearch 在若干规划器迭代中先建好知识流图再由 refiner 用六种编辑操作改写)都属于 Plan-then-Patch:在任何节点执行之前就提交覆盖全任务的计划,之后靠补丁修复。DAGent 让每个节点(包括答案节点)只在其依赖节点执行并评估之后才被创建,且节点从不被删除或重连。 论文以同架构消融隔离该因素:把 Evaluate-then-Grow 换成 Plan-then-Patch 在三个基准上损失 5.3/4.8/4.0 分,进一步退化为无重规划的单次前置计划再损失 8.7/7.8/6.0 分,合计 14.0/12.6/10.0 分;Plan-then-Patch 变体复用 DAGent 的 Orchestrator、ReAct Executor、骨干、工具栈与上下文组件,仅改变跨迭代规划行为。

提出分层上下文层:每个节点默认只向下游传播紧凑 QueryDoc,把节点上下文按扇入而非图深度或节点总数界定(Selective Propagation),同时保留完整 InteractionTranscript,下游 Executor 可通过 RecallTool 按目标回取依赖节点的原始证据片段。 长程深度研究会产生任意长度的执行轨迹,而下游节点通常只需要依赖项的结论;该设计把“默认传播什么”和“按需回取什么”分开,使长程证据可用而不让每个子任务上下文过载。 消融显示去掉 Selective Propagation 损失 12.6/10.6/8.0 分,去掉 QueryDoc 损失 8.0/7.7/5.0 分,去掉 InteractionTranscript(同时禁用 recall)损失 4.0/2.9/2.0 分;在 Qwen3-32B 运行中 RecallTool 仅在 22.0/13.6/11.0% 的任务上被调用,平均每任务 0.33/0.21/0.18 次,说明它是回退通道而非默认通道。

提出 DAGRPO:在 GRPO 式目标上加入两个由记录拓扑唯一确定的结构信号——对 ReAct Executor rollout 的拓扑条件信用(落在 answer 型节点的 answer-inclusive closure 内保留全额,链外按系数衰减),以及对 Orchestrator 计划的结构合规正则(惩罚未给上一批节点显式状态、未在三次预算内精化弱节点、answer 节点未单独成批、重复子任务提示、JSON 不可解析或依赖引用无效等违规)。 纯结果 GRPO 把轨迹级奖励均匀分配给所有 rollout,忽略 DAG 位置带来的贡献差异;而 append-only 生长使节点的最终图祖先关系恰好等于它运行时看到的上下文,这一性质在可删除或重连节点的 Plan-then-Patch 轨迹中不成立。 在 Qwen3-8B 上,DAGRPO 把 DAGent 的 BrowseComp-Plus/GAIA/xbench-DeepSearch Pass@1 从 40.0/46.6/60.0 提升到 49.6/53.4/65.7(三个种子),比同预算纯结果 GRPO 基线高 3.6/2.6/2.7 分;去掉拓扑信用损失 2.3/1.9/1.7 分,去掉合规正则损失 1.6/1.0/0.7 分,链外信用系数在三个基准上均于 0.5 处取峰。

给出跨基准、跨骨干、跨规模的实证优势与效率证据:在 Qwen3-235B-A22B 规模上超过最强开源基线 5.3/5.8/2.0 分,在 Qwen3-32B 上以 47.3/55.3/65.0 超过 FlowSearch 4.0/3.8/2.0 分,优势在四家厂商的四个开源骨干上复现,并延伸到 327K 上下文的 GPT-5;同架构对比中 Evaluate-then-Grow 以更低的每任务 token、工具调用与步数取得更高准确率。 优势不是集中在单一设置:论文报告在每个难度分层上 DAGent 都追平或超过所有基线(235B-A22B 上有两处持平),且相对增益在 8B 与 32B 上随难度上升;效率方面 Plan-then-Patch 变体把链外 Executor 比例从 0.25/0.20/0.18 抬到 0.40/0.30/0.25,多花 40/29/18% token、28/21/21% 步数、35/27/21% 外部工具调用与 35/27/23% 墙钟时间,准确率仍低 5.3/4.8/4.0 分。 主表覆盖三个基准、三个 Qwen3 规模与训练/免训练两种设置;跨骨干表覆盖 Qwen3-32B、Seed-OSS-36B、GLM-4-32B、Nemotron-3-Nano-30B;效率表在 Qwen3-32B 免训练模式下给出每任务均值,并说明 32KN 是每子任务上限而非每任务预算。

启示与展望

该结果面向需要多步检索与证据综合的深度研究智能体,适用于有固定检索后端、答案可由 LLM 判官核验的封闭式问答基准(BrowseComp-Plus 的 150 题评测划分、GAIA 的 103 题纯文本验证子集与 165 题全集、xbench-DeepSearch 2505 版的 100 道中文题)。它使规划者可以在证据到达后再决定扩展哪些分支,从而在同等或更低 token、工具调用、步数与墙钟成本下获得更高准确率;对希望把 DAG 拓扑直接用作 RL 信用分配信号的训练流程,append-only 生长提供了“节点最终祖先即其运行时上下文”这一可依赖性质。分层上下文层与 RecallTool 为长程证据使用提供了默认传播与按需回取的组合,适合每子任务上下文受限(8K 提示加 32K 响应)的多智能体部署。

论文自述 DAGent 是文本原生的,用于 GAIA 全集的扩展在规划开始前把附件转成文本,若要在循环内处理多模态证据,需要改动 Orchestrator 的证据评估方式与 Executor 的轨迹表示;其准确率也依赖搜索引擎、检索嵌入与页面抽取的质量,无法创造检索器未取回的证据。answer-inclusive closure 是贡献的结构代理而非因果归因,结构合规与准确率之间的关联被作者明确描述为相关性而非因果估计,DAG 多智能体系统中的逐节点因果归因仍是开放问题。三个基准都有可由 LLM 判官核验的封闭式答案,开放式报告生成不在本文证据范围内。RL 实验只在一个骨干(Qwen3-8B)上用 LoRA 训练 21 个更新步、三个种子,DAGRPO 的增益在更大训练规模、更长训练计划或全参数微调下是否保持,本文未予确立;此外消融中部分单种子行与三种子均值的差异落在种子噪声范围内,作者以各基准差异符号的一致性作为两个结构信号的支持证据。

来源