跳到主要内容
返回时间线
arXiv来源发表:

ACG 用持久证据图把长程智能体成功率从 44.5% 提到 50.2%,BrowseComp-Plus 上提升 11.1 个百分点

核心概要

该工作提出自适应一致性图(ACG),把执行证据及其来源增量组织进一张持久图,并在受限上下文预算下为每一步决策构造以需求为中心的临时视图,在不替换原有规划器与工具执行器的前提下,使 GPT-5.6-luna 在三个基准上的等权平均成功率从 ReAct 的 44.5% 提升到 50.2%,其中 BrowseComp-Plus 从 62.4% 升至 73.5%。

AI-generated editorial illustration: Adaptive Consistency Graph for Long-Horizon Agents

深度剖析

ACG 把执行证据存成带来源链接的持久记忆单元,每个单元保留其内容、类型、来源引用、发生事件与结构化字段,重复内容可共享同一单元但各自保留发生记录。 与把历史压缩成生成式摘要的记忆方案不同,ACG 不覆盖底层记录,被省略的证据仍留在可寻址的执行记录中供后续检索。 论文以形式化定义给出记忆单元与发生记录的关系,并在附录说明 ingest 操作保留事件身份、来源引用与需求来源信息,且不会用语义相似度补全缺失的归属。

每一步决策时,ACG 用原始任务与最近一次交互共同播种检索,经轮询交错选出种子,再沿互近邻语义边与来源亲和边做固定一跳图扩展,形成以需求为中心的临时视图。 相较只做检索或只做压缩的基线,ACG 把关系组织与读出放在同一套机制里,且视图是只读的临时投影,不回写持久图。 配置为 8 个唯一检索种子、固定一跳扩展、每个需求最多保留 8 条历史候选,记忆视图上限 5,000 token,并随剩余预算进一步收缩。

在匹配评测中,ACG 在 GPT-5.6-luna 上把三基准等权平均成功率从 ReAct 的 44.5% 提升到 50.2%,BrowseComp-Plus 从 62.4% 升到 73.5%;DeepSeek-v4-flash 上平均为 45.9%。 论文强调增益依基准与模型而异:Luna 的 DeepPlanning 仅 12.4%,DeepSeek 的 DeepPlanning 为 11.7%,因此结论是条件性的而非普遍提升。 三个固定任务集分别为 360、830、300 个任务,名义预算 100 次外部动作,执行器单次输出上限 4,096 token,标准差来自 5,000 次任务自助重采样。

诊断分析显示,ACG 的失败更多落在交付物通过官方评测这一环,而非停滞或重复执行:DeepSeek 在 SWE-bench Lite 上 ACG 失败中重复执行占 8.2%、缺失交付物占 0.9%,而 ReAct 分别为 6.2% 与 26.2%。 这把“避免卡死”与“产出正确解”区分开来,说明更少的重复动作或更频繁的交付不能替代官方成功率。 诊断基于确定性轨迹观察,六类指标各自使用可评估任务分母,并按成功与失败任务分别统计。

启示与展望

该结果面向需要在长序列依赖动作与工具调用中保持目标一致性的语言模型智能体,适用于受限规划、固定语料检索与仓库级代码修复三类任务,且以不替换基础规划器与工具执行器为前提,因此可作为现有智能体框架之上的一层上下文构造机制。对实践者而言,ACG 提供的是可追溯的证据组织方式:被视图省略的记录仍留在持久记忆中,后续决策可再次取用,这为在有限 token 预算下同时保留全局目标线索与即时交互信息提供了可操作的配置起点。

论文自身指出,来源归属只验证关联的出处,并不证明观察为真或需求已被满足;缺失或含糊的动作来源会降低需求级覆盖,有限预算也可能排除相关证据,图构建与检索还会带来基础执行器之外的额外计算。基线分析是观察性的,任务结构与实际执行长度同结果相关,但不识别失败原因。此外,等权平均只是三个基准的汇总,不应读作合并估计;执行长度分箱是不同轨迹组的条件比较,而非匹配任务的收益估计。泛化到未评测的模型、工具与任务集仍待确立。

来源