AED 把 50,228 条失败轨迹变成错误—诊断对:首次修正让验证器通过率从 18.4% 升到 51.1%,全诊断微调把 Qwen3-8B 的步级一致率从 47.2% 提到 63.6%
核心概要
该工作构建了 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,并用五阶段 Agentic Error-to-Training(AET)流水线把自然失败连到诊断、修正建议与可选回放证据;在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%(+32.7 个百分点),在单独冻结的诊断发布上做全诊断微调,使 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 升至 63.6%(三个种子、943 例留出集平均),而单种子的 actor 训练对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练
深度剖析
AED 把“失败的 rollout 不只是奖励信号”这一观察落成一个可复用的规模化资源:50,228 条错误—诊断对,覆盖 33 个环境、19 个 harness 家族、23 个策略模型,并保留源轨迹与执行元数据,使跨设置的失败分析与重新诊断无需重跑原始 rollout。 此前的失败归因资源规模较小且设置各异,例如 Who&When 为 184 条自然多智能体失败、MAST 为 1,642 条轨迹、AgenTracer 为 2,000 条,且各自的目标(失败模式、责任智能体、归因模型)不同;AED 把自然失败、解释、修正建议与执行证据放在同一集合中,并同时支持诊断与动作两类训练视图。 集合计数来自与图 3 同一套源链接配对索引,并要求每个环境、harness 家族或策略模型至少有 10 个不同源任务;论文明确说明集合规模计的是错误—诊断对,不等于独立执行次数或可直接训练样本数,且同一执行的多份诊断会增加配对而不增加独立失败观测。
AET 流水线把诊断与修正建议接到受控回放上:在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%,即 32.7 个百分点(任务聚类区间见附录)。 以往工作多停留在失败归因或注入故障验证,AED 在同一 checkpoint、同一 harness、同一预算与验证器下,把修正动作与原始动作重试配对比较,并保留成功重试与失败修正两类结果,从而区分“通过的分支”与“动作偏好的证据”。 配对回放使用温度 0.2 首次采样、0.8 后续采样,两臂共享同一调度;论文同时指出原始动作重试本身也有成功,净增益来自不一致单元格之差,且单次配对结果不能识别个体因果效应或证明修复不必要。
在单独冻结的诊断发布上做全诊断 SFT,把 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 提升到 63.6%(三个种子、943 例留出集平均),且四个递增训练规模上平均一致率逐级提高;同一比较中最强的提示参考为 54.7%。 这给出了一条可操作的“用失败经验训练诊断模型”的路径,并报告了规模阶梯;论文强调该比较衡量的是与记录标注(含其约定与缺陷)的一致程度,而非诊断能力的通用排名,且学生从共识生成的标签学习,参考模型未在这些标签上训练。 三个种子、943 例留出集、四个嵌套训练规模;论文同时报告公开基准上的迁移是协议依赖的:在 Who&When 上排除被标记的任务重叠后区间包含零,TrajErrBench 平均准确率低于基座,因此内部定位是受支持的结果,公开迁移仍是范围限制。
在单种子的 actor 训练配方对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练高 6.67 个百分点,而含修复的配方在 TextQuest 上更低;在真实 ALFWorld 与 ScienceWorld 上,预防式修复臂低于未训练策略。 这把“从失败中学习”从诊断延伸到动作策略,并明确区分预防式、事后仅动作与事后带反思三类监督;论文指出这些配方在任务池、曝光与优化步数上不同,对比衡量的是组合配方而非修复监督本身。 单种子、六个开发环境,事后 Holm 校正后 WebShop-lite 的仅动作与反思增益以及 TextQuest 的三项损失仍保留;真实环境对比只覆盖预防式修复臂,ScienceWorld 有六个 run error 被排除在修复分母之外。
启示与展望
该资源面向文本型智能体系统,用于跨执行设置的失败分析、诊断训练与动作恢复训练;回放证据只在支持回放的环境子集上成立,且要求同一 checkpoint、同一 harness、同一预算与验证器。对希望复用失败经验的研究者,AED 提供源轨迹、执行元数据与可选回放分支,使重新诊断无需重跑原始 rollout;对希望训练诊断模型或修复策略的团队,它给出诊断 SFT、恢复 SFT 与动作偏好三类视图及各自的准入规则。论文明确说明集合规模计的是错误—诊断对,训练结果来自更小的冻结人群,因此该资源适合作为失败分析与错误感知后训练的起点,而非全集合效用的度量。
公开基准上的迁移是协议依赖的:Who&When 上排除被标记的任务重叠后区间包含零,TrajErrBench 平均准确率低于基座,AgentErrorBench 的点估计改善没有清晰的配对优势。actor 对比为单种子,配方之间在任务覆盖、曝光与优化步数上不同,因此对比衡量的是组合配方而非修复监督本身;真实 ALFWorld 与 ScienceWorld 上只有预防式修复臂有对比,且出现下降。诊断微调衡量的是与内部教师标签的一致程度,教师标签来自异构共识,包含其约定与缺陷,因此不等同于独立标签上的能力排名。回放证据依赖状态恢复与 harness 支持,替代 harness 或部分恢复状态下的对比不能直接外推到原系统。此外,本次加载的是全文文本,图表与附录中的具体数值表格未逐格呈现,若需精确的区间与分环境结果,仍需查阅原文表格。
