跳到主要内容
返回时间线
arXiv来源发表:

AECG 在三种多智能体框架四个基准中 12 项设置 11 项最优,消融显示移除作用域保持最多掉 16.89 分

相关研究与后续进展

核心概要

作者提出 AECG 多智能体记忆治理框架,通过作用域保持、非对称证据准入、双时间尺度可靠性估计与基于下游暴露度的预算化审查,把记忆从静态存储变为可靠性治理闭环;在 AutoGen、MacNet、AgentNet 三种框架与 PDDL、FEVER、ScienceWorld、MBPP-Plus 四个基准的 12 项设置中 11 项取得最优,较最强记忆基线最高提升 10.23 个百分点,移除作用域保持最多降低 16.89 分。

Source-provided article image: AECG: Asymmetric Experience Consolidation and Governance In Multi-Agent Systems
Figure 1 ·

Figure 1: Conceptual comparison of memory maintenance: coarse accumulation or reactive revision risks persistent errors and utility loss, whereas AECG targets governance for reliable reuse.

arXiv

深度剖析

AECG 将多智能体程序性记忆从被动累积重构为生命周期治理闭环,包含作用域保持、非对称证据准入、双时间尺度可靠性估计、暴露度感知的预算化审查、证据路由干预与配对回放激活。 既有工作侧重经验表示、技能抽象与检索,AECG 转而治理知识在持续复用下的可靠性衰减与跨层级传播。 方法在三种框架与四个基准上实例化,并配有消融与机制实验;执行使用 gpt-4.1-mini,记忆层调用使用 gpt-4o-mini,结果取三次独立随机种子平均。

作用域保持是消融中最关键的组件:移除后 ScienceWorld 成功率下降 16.89 分、MBPP-Plus 下降 8.34 分;扁平作用域使 36.5% 的选用跨越其证据支持的协调作用域,且这些跨作用域使用的平均失败任务暴露度为 14.8。 该结果把作用域崩塌与更低成功率及更广的结构可达范围联系起来,并显示扁平作用域在 ScienceWorld 上仅 51.29,低于无记忆基线 55.68。 消融在 AgentNet–ScienceWorld 与 MBPP-Plus 上进行,采用共享的预热后记忆快照与匹配条件;暴露度被明确界定为结构可达性度量而非因果传播估计。

双时间尺度信念克服历史成功惯性:AECG 平均在 3.8 次使用后审查被污染技能,而仅累积变体为 9.7 次,检测延迟降低 60.8%;污染技能失败使用从 17.9 降至 6.4,污染后成功率从 58.2% 升至 64.5%。 由于两者接收相同历史证据,延迟下降隔离出快速信念的作用,使近期矛盾结果不被累积成功淹没。 受控污染实验在 AgentNet–ScienceWorld 上进行,注入四个经三项匹配验证任务校验的污染技能,并设无治理参照点(31.2 次污染失败使用、49.3% 成功率)。

下游暴露度在固定审查预算下改善高风险技能优先级:暴露度感知排序在前两次审查覆盖 81.5% 的污染技能预测暴露度,风险仅排序为 53.2%、随机为 49.8%;污染后成功率分别高出 4.3 与 8.4 分,实际失败任务暴露度降至 22.4,对比 48.6 与 61.2。 所有方法共享同一置信门、污染集、干预规则与审查预算,因此增益隔离出优先级排序本身的价值。 预算化分诊实验每轮最多一次审查,合格候选数超过预算,覆盖率为排序诊断指标,污染后成功率为主要结果。

启示与展望

该工作面向以执行图刻画的多智能体任务流,适用于需要跨任务复用程序性知识、且审查算力有限的部署场景。作用域保持、双时间尺度信念与暴露度感知分诊可分别用于约束复用边界、及早发现退化、在固定预算下优先处理高传播风险技能。方法依赖局部反馈的校准,暴露度被界定为结构可达性代理而非因果影响估计,因此其结论适用于结构风险排序与治理调度,而非因果归因。

读者仍需关注:失败归因依赖双 LLM 评判的一致性门限,其校准质量如何随任务域变化尚待观察;暴露度作为结构代理在多大程度上近似真实因果传播仍是开放问题;受控污染与预算化分诊实验集中在 AgentNet–ScienceWorld,其他框架与任务族下的机制表现有待进一步验证;超参数虽固定,但其在更大规模或更长任务流下的稳定性仍需检验。

来源