DeReAct 将动作校验与完成认证外置,使 Qwen3-Coder-480B 在 GAIA 与 SWE-bench Verified 上 Pass@1 提升 6.5–7.0 分
相关研究与后续进展核心概要
DeReAct 提出一种模块化智能体架构,把动作授权与完成判定从单一 LLM 策略中分离出来,交由 Critic 在执行前校验提议动作、由 Context Manager 重建环境支持的 State 并认证任务完成;在 GAIA 与 SWE-bench Verified 上,它对较弱 Brain 模型提升最大(Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分),随 Brain 能力增强增益递减,而在 Claude Opus 4.5 上 Pass@1 与 ReAct 相当但轨迹更具证据完整性与约束满足性。
Figure 2: Pass@3 lift versus Pass@1 lift over ReAct for all configurations across both benchmarks, Brain tiers, CM models, window sizes, and prompts. The vertical distance from the y = x y{=}x diagonal is Diff. Nearly every point lies above the diagonal. In the shaded region, DeReAct trails ReAct per attempt yet solves more distinct tasks at least once.
arXiv深度剖析
DeReAct 把 ReAct 式智能体中耦合在单一 LLM 策略里的动作授权与完成控制拆分为两个外置门控策略:Critic 在执行前校验提议动作,Context Manager 重建环境支持的 State 并认证任务完成。 相对依赖单一策略同时提议动作、与环境交互并自行判定任务结束的 ReAct 基线,该工作将授权与完成判定显式外置,使二者可被独立强制执行。 摘要以架构描述与设计动机陈述该机制,并说明其针对的是错误传播与无依据完成声明终止执行这两类耦合问题。
在 GAIA 与 SWE-bench Verified 上,DeReAct 对较弱 Brain 模型的 Pass@1 提升最大:Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分,且增益随 Brain 能力增强而递减。 该结果给出了外置门控收益随基础模型能力变化的经验规律,而非单一模型上的孤立提升。 摘要报告了两个基准上的 Pass@1 增益区间,并明确增益随 Brain 能力提高而减小。
轨迹与消融分析表明,外部门控在目标失败足够普遍且门控策略本身充分时有效。 该分析把外置门控的有效性条件显式化,指出其收益依赖失败分布与门控策略质量两个前提。 摘要以轨迹与消融分析作为该结论的依据,未给出具体消融数值。
在 Claude Opus 4.5 上,DeReAct 的 Pass@1 与 ReAct 相当,但产生更具证据完整性与约束满足性的轨迹,说明完成控制可以用更早终止换取更强 grounding。 该观察把评估维度从单一 Pass@1 扩展到轨迹的证据完整性与约束满足性,提示完成控制存在终止时机与 grounding 之间的权衡。 摘要报告 Pass@1 相当,并以轨迹属性差异作为 grounding 收益的证据。
启示与展望
该工作面向需要可靠动作授权与完成认证的 LLM 智能体系统,适用于 GAIA 与 SWE-bench Verified 所代表的任务设定,并以 Brain 模型能力为调节条件:对较弱 Brain 模型收益最大,随能力增强而递减。其设计意图是让动作校验与完成判定可被独立强制执行,从而减少错误传播与无依据完成声明终止执行的情况;对使用 Claude Opus 4.5 这类强模型的场景,收益体现为轨迹的证据完整性与约束满足性而非 Pass@1。
摘要层面未给出样本量、方差、统计检验与消融的具体数值,也未说明 Critic 与 Context Manager 的实现细节、门控策略的构造方式以及 GAIA 与 SWE-bench Verified 上的分项结果;因此外部门控在何种失败分布下收益最大、门控策略需达到何种充分程度,以及轨迹证据完整性与约束满足性的度量方式,仍是需要阅读全文才能确认的开放问题。
