arXiv 2026年10月5日DeReAct 提出一种模块化智能体架构,把动作授权与完成判定从单一 LLM 策略中分离出来,交由 Critic 在执行前校验提议动作、由 Context Manager 重建环境支持的 State 并认证任务完成;在 GAIA 与 SWE-bench Verified 上,它对较弱 Brain 模型提升最大(Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分),随 Brain 能力增强增益递减,而在 Claude Opus 4.5 上 Pass@1 与 ReAct 相当但轨迹更具证据完整性与约束满足性。DeReAct 提出一种模块化智能体架构,把动作授权与完成判定从单一 LLM 策略中分离出来,交由 Critic 在执行前校验提议动作、由 Context Manager 重建环境支持的 State 并认证任务完成;在 GAIA 与 SWE-bench Verified 上,它对较弱 Brain 模型提升最大(Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分),随 Brain 能力增强增益递减,而在 Claude Opus 4.5 上 Pass@1 与 ReAct 相当但轨迹更具证据完整性与约束满足性。DeReAct 将动作校验与完成认证外置,使 Qwen3-Coder-480B 在 GAIA 与 SWE-bench Verified 上 Pass@1 提升 6.5–7.0 分DeReAct 提出一种模块化智能体架构,把动作授权与完成判定从单一 LLM 策略中分离出来,交由 Critic 在执行前校验提议动作、由 Context Manager 重建环境支持的 State 并认证任务完成;在 GAIA 与 SWE-bench Verified 上,它对较弱 Brain 模型提升最大(Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分),随 Brain 能力增强增益递减,而在 Claude Opus 4.5 上 Pass@1 与 ReAct 相当但轨迹更具证据完整性与约束满足性。DeReAct 提出一种模块化智能体架构,把动作授权与完成判定从单一 LLM 策略中分离出来,交由 Critic 在执行前校验提议动作、由 Context Manager 重建环境支持的 State 并认证任务完成;在 GAIA 与 SWE-bench Verified 上,它对较弱 Brain 模型提升最大(Qwen3-Coder-480B 提升 6.5–7.0 分,Claude Sonnet 4.5 提升 4.2–5.2 分),随 Brain 能力增强增益递减,而在 Claude Opus 4.5 上 Pass@1 与 ReAct 相当但轨迹更具证据完整性与约束满足性。