Sentry 让 LLM 智能体在测试时按需检索失败教训,在多个基准上平均超越最强运行时干预基线 37%
相关研究与后续进展核心概要
该工作提出 Sentry——一个与智能体并行运行的失败管理层:检测到失败时从外部 playbook 检索匹配教训引导恢复,在无任务奖励的情况下验证智能体是否恢复,仅在恢复成功时写入新教训,且完整 playbook 从不进入智能体上下文;在多个智能体基准上,Sentry 在每个基准上都优于最强运行时干预基线,平均提升 37%,在两者均被评估的两个基准上优于最强上下文演化基线 39%,与上下文演化结合还能带来进一步增益,学到的教训可迁移到留出任务,受控实验显示把完整 playbook 暴露给智能体会降低性能。
Figure 1: Two ways failure knowledge goes wrong (Qwen3.5-9B on WebShop). (a) Always exposed: recovery rules learned by ACE stay in the agent’s context; after finding a matching item, the agent keeps comparing alternatives and takes no action. (b) Never learned: AgentGuard’s fixed no-progress warning resolves a search loop, but no lesson is stored; in a later task, the same warning fires after valid option selections, and the agent leaves the page and loses them.
arXiv深度剖析
论文提出失败知识是条件性知识,应当被条件性暴露:教训只在对应失败出现时才应进入智能体上下文。 此前做法要么把失败教训常驻上下文(上下文演化),要么只在失败发生时临时干预而不学习(运行时干预);该工作把“何时暴露”本身作为设计原则提出。 受控实验显示,把完整 playbook 暴露给智能体即使相关教训仍可按需获取,也会降低性能;从演化中的 playbook 移除教训可提升性能。
Sentry 作为与智能体并行的失败管理层,实现检测失败、检索匹配教训、无奖励验证恢复、仅在成功时写入新教训的闭环。 运行时干预会修复但不学习,上下文演化会学习但把知识常驻上下文;Sentry 将学习与暴露分离,完整 playbook 从不进入智能体上下文。 在多个智能体基准上,Sentry 在每个基准上都优于最强运行时干预基线,平均提升 37%;在两者均被评估的两个基准上优于最强上下文演化基线 39%。
Sentry 学到的教训可迁移到留出任务,且与上下文演化结合可带来进一步增益。 说明按需检索的失败教训不是对特定任务的过拟合,而是可与既有上下文演化方法叠加的互补机制。 论文报告了留出任务上的迁移结果,以及 Sentry 与上下文演化组合后的进一步增益。
启示与展望
该结果面向需要在测试时提升可靠性的 LLM 智能体系统,适用于存在可检测失败信号、且可维护外部 playbook 的运行环境;方法被设计为与智能体并行运行的失败管理层,因此其收益以智能体本身可被观测和干预为前提。对希望在不改动智能体主体的情况下增加恢复能力的工程实践者,以及研究上下文管理与测试时适应的读者,这一条件性暴露原则可直接借鉴;与上下文演化结合可进一步增益,说明两类机制可共存。
摘要未给出各基准的具体名称、任务规模、失败类型分布与统计显著性,也未说明验证恢复所用的具体判据;playbook 的规模、检索匹配方式与教训写入的粒度同样未在摘要中展开。读者若关心这些细节,需要查阅正文的基准设置与消融实验。此外,摘要所述“多个智能体基准”的具体构成与留出任务的划分方式,是判断迁移结论适用范围时需要进一步确认的开放问题。
