跳到主要内容
返回时间线
arXiv来源发表:

CogMem 用 PEC2F 图结构与智能体检索重构长期对话记忆,在 LoCoMo 与 LongMemEval 上取得最高准确率

核心概要

该工作提出 CogMem,一种基于 PEC2F(人物-事件-概念-主张-事实)图模式的免训练认知记忆架构:用 Claim 节点保留主观陈述的来源与对象,将对话轮次增量转为带来源的图记录并整合为高层事实,再由 LLM 意图解析驱动的规则控制器组合锚定、遍历、交集与证据落地四种图算子重建上下文;在 LoCoMo 与 LongMemEval 上,多跳、时序与知识更新任务表现突出,消融与语义坍缩探针支持认知分离、整合与智能体检索的互补贡献。

Source-provided article image: From Retrieval to Reconstruction: Constructing Evolvable Cognitive Memory for Long-Term Dialogue
Figure 1 ·

Figure 1: The Paradigm Shift from Passive Retrieval to Active Reconstruction. Left (traditional RAG and flat memory): passive retrieval over coarse text chunks introduces noise and may miss relevant counter-evidence. Even when a related statement is retrieved, the flat representation obscures its source and can cause the LLM to treat an attributed opinion as an unqualified record. Right (CogMem): a PEC 2 F cognitive graph supports active reconstruction, allowing the agent to attribute conflicting viewpoints to their sources and synthesize an evidence-grounded answer.

arXiv

深度剖析

PEC2F 模式通过 Claim 节点把来源归属的主观信念与无归属的事件/事实记录在结构上分开,缓解“语义坍缩”。 以往 RAG 与图检索系统(如 LightRAG、HippoRAG)使用任务无关的实体-关系图,不显式区分来源归属的主张与事件/事实记录;CogMem 将“Jon 被解雇”与“Gina 认为 Jon 被解雇是错的”建模为不同节点类型与两跳路径。 150 对合成事实-主张探针中,BGE-M3 平均余弦相似度 0.8231,扁平 RAG 误归属 64/150(42.7%),PEC2F 类型约束检索降至 9/150(6.0%);移除 Claim 节点使 LongMemEval 知识更新准确率从 73.08% 降至 56.67%。

离线记忆整合把稀疏情节痕迹抽象为高层 Fact 节点,并用 Evidence Mounting 保留来源链接,实现多分辨率检索。 不同于仅做存储或剪枝的记忆系统,CogMem 在事件簇达到阈值(3 个事件、30 天窗口)时触发 LLM 抽象,生成带时间包络的语义事实,同时以 SUPPORTED_BY 边保留原始情节。 整合使多跳 F1 提升 4.86 个百分点(43.56%→48.42%),平均推理步数从 3.42 降至 2.67;图节点增加 540、边增加 4708,属有意保留证据的加法式挂载。

基于 ReAct 的认知搜索智能体用 LLM 意图解析驱动规则控制器,动态组合四种确定性图算子进行主动回忆。 把检索从静态流水线转为智能体主动回忆:比较词触发交集、归属问句触发 Claim 关系、时间表达触发时序门控、验证问句触发证据落地。 移除智能体改用固定流水线后,多跳 F1 从 48.42% 降至 22.81%(下降 25.61 点),加权整体 F1 相对下降 65.4%;智能体平均工具调用 2.65 次,少于固定流水线的 3.00 次。

在 LoCoMo 与 LongMemEval 两个长期记忆基准上,CogMem 在两种骨干模型下均取得最高或领先成绩,尤其多跳、时序与知识更新。 相对 Naive RAG、Mem0、A-MEM、LightMem、GAM、LightRAG、HippoRAG 与零样本 RoG,CogMem 在结构化推理类别上提升明显。 Qwen2.5-14B 下多跳 F1 48.42%(GAM 42.96%、RoG 41.80%、HippoRAG 34.78%);LongMemEval 准确率 68.40%(GPT-4o-mini)与 66.50%(Qwen2.5-14B);50 例盲评人类偏好中胜 68%、平 20%、负 12%。

启示与展望

该架构面向需要跨会话重建证据的长期对话智能体,适用于英文多会话对话基准所代表的场景,并以 GPT-4o-mini 与 Qwen2.5-14B 两种骨干验证。它使检索结果可追溯到原始话语,Claim 调和只在同一来源、目标与谓词下进行,不同说话者的主张永不合并,因此适合需要保留分歧与来源的场景。对读者而言,这意味着若系统需要区分“谁说了什么”与“发生了什么”,PEC2F 的节点分离与 Evidence Mounting 提供了可直接借鉴的设计;若关注部署成本,其构建阶段约 1,578k token、推理阶段平均每问 6,610 token,可作为资源规划的参照。

评估覆盖两个英文长期对话基准与两种骨干,未建立对多语言对话、真实噪声对话或持续部署助手的泛化;语义坍缩探针为合成数据,人类偏好研究仅 50 例、两名主标注者与一名裁决者,属补充证据而非替代更大规模独立评估。LongMemEval 依赖 LLM 评判,可能继承模型特定偏差。错误分析显示时序归一化占时序类错误的 44%,向量语义漂移占总体 23%,整合带来的粒度损失占 11%,搜索范围不完整占 15%,这些是读者在迁移时需关注的开放问题。整合目前为周期性离线执行,实时增量整合与神经工具学习仍是未来方向。

来源