MemCo 用局部与全局双层记忆协作,让 LLM 智能体在未见环境中把 ALFWorld 留出布局准确率提升 43.47% 并减少 32.10% 交互步数
相关研究与后续进展核心概要
作者提出 MemCo 记忆中心协作框架,为每个智能体保留环境特定的局部记忆图,并把经证据聚合与 Wilson 下置信界筛选的可迁移工作流提升到共享全局记忆,在线决策时按当前状态、任务阶段与目标检索并落地局部与全局记忆;在 ALFWorld、PDDL、FEVER、ScienceWorld 四个基准与多个 LLM 骨干上,MemCo 在 12 个评测设置中 10 个取得最高准确率、9 个使用最少交互步数,例如 Qwen3-4B 下 ALFWorld 留出布局准确率相对次优基线提升 43.47%、步数减少 32.10%。
Figure 1: (a) Memory-centric collaboration among independently acting agents: each agent preserves environment-specific local experience while contributing reusable experience to global memory for use across environments. (b) and (c) ALFWorld performance on familiar and held-out layouts, respectively, with Qwen3-32B. Markers and error bars denote the mean and standard deviation.
arXiv深度剖析
MemCo 把跨环境经验共享拆成互补的局部与全局两层记忆,局部记忆图保留环境特定上下文,全局记忆只保留经角色抽象的可迁移工作流与前置条件。 既有共享记忆方法把跨任务或跨智能体的情节记忆直接汇总,检索时容易过细而失去当前落地或过粗而无法指导下一步;MemCo 让环境特定细节留在本地,只把可迁移关系提升到全局。 在 ALFWorld 上,仅局部记忆的留出布局准确率为 89.64%,仅全局记忆为 97.14%,完整系统为 97.86%,且完整系统在两个划分上步数都少于任一单独来源;这些是复用同一冻结局部记忆快照的受控对比。
全局记忆的准入使用单侧 Wilson 下置信界,把经验支持率与证据量一起纳入提升判据,并用确定性精确键合并抽象记录。 以经验支持率作为准入分数时全局库为 736 条记录,改用 Wilson 后降为 426 条,同时熟悉布局与留出布局准确率分别提升 2.27 与 1.43 个百分点,步数也减少。 两个变体每次决策注入的条目数接近,因此差异不能仅由提示长度解释;阈值从 0.25 升到 0.50 时全局库由 735 条降到 294 条,而准确率与轨迹长度保持不敏感。
查询引导的记忆支持按状态、任务阶段与目标三个维度打分,先做适用性硬过滤再排序,并在组合阶段把全局记录的角色绑定到当前环境。 固定拼接更多记忆反而更差:L5+G5 在熟悉与留出布局上分别落后完整 MemCo 10.71 与 16.07 个百分点,说明选择与组合方式本身带来收益,而非记忆数量。 去掉任一相关性维度或只保留单一维度都会降低两个划分的准确率并增加步数;用余弦相似度或 BM25 替换显式匹配也都不如完整方法。
在四个异构基准与多个 LLM 骨干上,MemCo 在多数设置中同时提升任务成功率并减少冗余探索。 相对次优基线,Qwen3-4B 下 ALFWorld 留出布局准确率提升 43.47%、步数减少 32.10%;GPT-4o-mini 下 FEVER 准确率提升 12.54%、步数减少 58.45%;ScienceWorld 上最终成功率与得分最高。 12 个评测设置中 10 个准确率最高、9 个步数最少;对 12 个匹配配置均值做精确双侧 Wilcoxon 符号秩检验并经 Holm 校正后,相对每个基线在准确率与步数上均显示改进,但作者说明该推断以块级假设为前提。
启示与展望
该结果面向以文本或符号观测进行多步决策的交互式智能体,适用于每个智能体在各自源环境积累经验、再在合并测试集上同时面对本域任务与未见环境任务的设定;ALFWorld 的 Familiar 与 Held-out 分别对应官方 valid_seen 与 valid_unseen 布局划分。对希望降低重复探索、在有限交互预算内部署智能体的研究者与工程师,MemCo 提供了可复用的分层记忆与查询引导组合流程,代码已公开。评测时局部与全局记忆均被冻结,测试轨迹不回写,因此它描述的是推理期经验复用而非在线持续学习。
全局记忆依赖初始交互轨迹启动,冷启动阶段可提供的全局指导有限;作者也指出该特性为所有基于检索的经验共享系统共有。评测仅覆盖文本与符号交互基准,向带视觉观测的多模态环境扩展仍是开放方向。受控消融复用同一冻结局部记忆快照,属于快照内对比而非主实验的独立重复;跨设置显著性分析以匹配的骨干–任务配置为块,配置间复用骨干与任务族,块间依赖可能限制推断解释。Wilson 界的一侧置信解释依赖二项抽样假设,情节级归约并不建立情节间独立同分布。
