该工作构建了 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,并用五阶段 Agentic Error-to-Training(AET)流水线把自然失败连到诊断、修正建议与可选回放证据;在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%(+32.7 个百分点),在单独冻结的诊断发布上做全诊断微调,使 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 升至 63.6%(三个种子、943 例留出集平均),而单种子的 actor 训练对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练
该工作构建了 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,并用五阶段 Agentic Error-to-Training(AET)流水线把自然失败连到诊断、修正建议与可选回放证据;在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%(+32.7 个百分点),在单独冻结的诊断发布上做全诊断微调,使 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 升至 63.6%(三个种子、943 例留出集平均),而单种子的 actor 训练对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练