EMFA用错误传播建模定位多智能体失败的决定性错误,在Who&When上把步骤级归因准确率提升3.45与4.40个百分点
核心概要
该工作提出EMFA,将失败的多智能体执行轨迹重构为结构化依赖表示,显式建模级联错误传播与持续交互循环,经双分支候选筛选与反事实验证定位“决定性错误”(即修正后能恢复失败执行的智能体–步骤对);在Who&When基准上取得最优步骤级归因准确率,较此前最佳在Hand-Crafted与Algorithm-Generated子集上分别提升3.45与4.40个百分点,智能体级准确率在Hand-Crafted子集最优、在Algorithm-Generated子集保持竞争力。
Figure 1: Illustration of why error-propagation modeling is needed to separate decisive errors from misleading failure symptoms.
arXiv深度剖析
提出以错误传播为中心的失败归因视角:失败轨迹中常同时存在多个看似错误的步骤,包括后来被纠正的偏差与仅继承早期错误的下游症状,因此需要追踪错误如何影响后续执行,而非孤立判断单步。 既有直接推理、重放、微调与结构引导方法多把归因视为从观测失败中挑选可疑步骤,未在候选选择前显式建模错误如何跨轨迹传播或在未解决的交互循环中持续。 该视角由问题形式化支撑:决定性错误被定义为“修正该步骤动作即可恢复失败执行”的智能体–步骤对,并按基准标注协议取最早的决定性错误作为归因目标。
EMFA将扁平执行日志转换为两级依赖表示(步骤级生产者–消费者依赖与子任务级依赖),并在此基础上提取互补的两类失败结构:沿信息依赖传播的错误传播图与反复处理同一未解决目标的持续循环图。 相较CHIEF依赖分层因果图排序候选、FALAT在候选剪枝后才引入传播分析,EMFA在候选选择之前就显式建模完整错误传播,并独立提取不沿普通信息依赖路径的循环结构。 方法由五个阶段构成:最终失败步骤识别、结构化轨迹构建、错误传播建模、双分支候选筛选、反事实决定性错误验证;并辅以确定性后处理补全指令–响应依赖,以及针对显式或遗漏必需动作的确定性检查。
双分支候选筛选与反事实验证相结合:传播分支优先选取最早且实质影响后续推理或动作的未恢复偏差,循环分支定位发起或维持未解决重复的最早步骤,各分支最多贡献两个候选,去重后由验证器判断最小修复能否阻止下游失败。 验证采用基于模型的反事实评估而非环境重放,与Who&When的专家判断标注协议一致;当多个候选修复都能恢复执行时,用预定义责任边界原则区分引入错误的步骤与仅执行、传播或暴露错误的步骤。 消融实验显示完整EMFA在所有指标上优于直接LLM筛选与两个单分支变体;移除传播分支导致步骤级准确率大幅下降,移除循环分支在Hand-Crafted子集下降较小,但在Algorithm-Generated子集使步骤级准确率从50.00%降至33.33%。
在Who&When基准上,EMFA取得最优步骤级归因准确率,Hand-Crafted为32.76%(较CHIEF提升3.45个百分点),Algorithm-Generated为50.00%(提升4.40个百分点);智能体级准确率在Hand-Crafted子集为74.14%为最佳,在Algorithm-Generated子集为66.67%。 所有方法中步骤级准确率均明显低于智能体级准确率,说明精确定位决定性步骤更难;EMFA在这一更严格指标上于两个子集均取得一致提升。 测试集包含Hand-Crafted的58条Magentic-One日志与Algorithm-Generated的126条CaptainAgent日志,任务来自GAIA与AssistantBench,真值经多轮专家共识获得;EMFA结果取三次独立运行平均,采用严格Top-1标准,且不使用任务真值。
启示与展望
该结果面向回合制、每步恰有一个智能体行动的LLM多智能体系统,并在Who&When基准的失败归因设定下评估,归因目标为按标注协议取最早的决定性智能体–步骤对。适用场景包括失败轨迹的调试、定向修复与从失败执行中学习;方法可在GPT-4o、DeepSeek-V4-Flash、Qwen3.5-397B-A17B、GLM-4.7等不同骨干上实例化,其中GPT-4o在两个子集上表现最好。评估覆盖Hand-Crafted(58条Magentic-One日志)与Algorithm-Generated(126条CaptainAgent日志)两个子集,任务来自GAIA与AssistantBench,真值经多轮专家共识获得,且所有实验不使用任务真值。
轨迹长度分层分析显示,EMFA与CHIEF在部分较长轨迹上智能体级准确率较低,文中给出的可能解释是结构引导方法引入较强归纳偏置,可能遗漏其结构未表示的失败模式;这一解释尚待进一步验证。方法引入额外推理开销,更高效的传播建模策略被列为未来工作。此外,正文中若干公式、阈值与实现细节(如温度、最大生成长度)在文本中未完整呈现,相关提示、配置与成本分析位于补充材料,因此对这些细节的复现需查阅补充材料。
