Jev-Mem 用 System-One 控制平面管理智能体记忆,在 LoCoMo 上把总体得分提到 0.777,同时把记忆构建时间压到 158 秒
核心概要
Jev-Mem 提出一种受 System-One/System-Two 认知分工启发的智能体记忆架构,用专门的 System-One 控制平面负责记忆类型判定、关系构建、查询路由、检索预算分配、图遍历、候选打分与自适应停止,只把复杂推理和答案合成交给 System-Two;在 LoCoMo 上取得 0.777 的 LLM-as-a-Judge 总体得分(相对最强基线提升 11.0%),记忆构建时间 158 秒(相对最快竞争系统 6.6 倍加速),平均查询延迟 0.93 秒(降低 36.7%)。
深度剖析
论文把记忆控制本身当作一等系统层,提出 System-One 控制平面加共享多关系记忆数据平面、再加 System-Two 推理平面的三段式架构,写入路径做记忆类型判定、冗余过滤以及语义、时间、因果、实体四类关系构建,读取路径做查询路由、检索预算分配、图遍历、候选打分、证据评估与自适应停止。 既有智能体记忆系统要么依赖固定启发式,要么在记忆构建与检索中反复调用自回归 LLM 做自由文本决策;Jev-Mem 把这些高频但输出有界的判断改为类型化概率决策,并让同一控制抽象贯穿写入与读取两侧,而不是写入用一套启发式、检索用另一套。 论文给出完整算法设计,包括类型化控制器接口、候选发现与关系判定分离、关系边插入阈值、预算分配与停止判据,并在附录中复现了写入、巩固、路由、候选打分与停止所用的类型化提示模板;作者说明这些返回值为模型自报数值,不假定为已校准概率。
在 LoCoMo 长程多会话对话基准上,Jev-Mem 取得 0.777 的总体 LLM-as-a-Judge 得分,高于最强基线 MAGMA 的 0.700,相对提升 11.0%,并在六类问题中的五类最好、时间推理与最好结果持平。 增益集中在需要跨记忆组合证据或区分干扰项的场景:Multi-Hop 为 0.623 对最强基线 0.569,Open-Domain 为 0.618 对 0.517,Adversarial 为 0.962 对 0.742;论文将其归因于按查询自适应地选择关系视图、分配检索预算并在遍历中评估候选与判断证据是否充分。 结果来自论文表 1,对比 Full Context、A-MEM、MemoryOS、Nemori、MAGMA 等代表性长期记忆方法,并在适用时使用相同骨干答案模型;评测指标为 LLM-as-a-Judge 正确性评分。
效率方面,Jev-Mem 的记忆构建总时间为 158 秒,比最快的竞争记忆系统 1044 秒减少 84.9%(6.6 倍加速),平均查询延迟 0.93 秒,比最快的记忆类基线 1.47 秒低 36.7%,比直接处理完整上下文的 1.74 秒低 46.6%。 论文指出效率来自把记忆控制移出自回归推理路径:构建时把轻量类型化决策在有限候选集上批处理,检索时由 System-One 完成路由、候选评估与证据检查,并用显式搜索预算和自适应停止约束图扩展;作为对照,MemoryOS 每查询需 32.68 秒。 结果来自论文表 2,报告端到端记忆构建时间与平均每查询延迟;论文同时说明控制开销有显式上界,包括图扩展、检查边、访问节点、深度、控制器调用次数与时间预算的独立限制。
论文把 System-One/System-Two 的划分落到记忆子系统上,并明确这是一种计算分配上的类比,而非声称底层机制与人类双过程推理相对应。 此前类似划分多用于单次推理回合内的额外审议(如 System 2 Attention、Tree of Thoughts、Graph of Thoughts),或用于在模型之间路由完整请求;Jev-Mem 把该原则用在更细粒度上,区分高频有界的记忆控制决策与开放式生成推理。 论文在相关工作与设计动机中给出这一区分,并说明 Jev 只是 System-One 控制器的一种具体实现,架构上的关键新颖点是把轻量记忆控制与审议式推理在构建和检索两侧分离。
启示与展望
这项工作面向需要跨会话保留与调用经验的持久智能体,例如编码助手、个人智能体、研究智能体与自主工作流;其结论适用于以长程多会话对话记忆为评测对象的设定,即 LoCoMo 这类需要时间、因果与跨会话推理的基准。对希望降低记忆构建与检索开销、又不想牺牲答案质量的工程实践者,论文给出的可复用要点是:把记忆类型判定、关系构建、查询路由、预算分配、候选打分与停止判断做成有界输出的结构化决策,并让写入与读取共用同一控制抽象;同时用显式预算与停止判据约束控制过程本身的开销。论文也说明,若需要更高层文本抽象,控制平面可以把已批准的合并或提升显式升级给 System-Two,因此生成是结构化控制决策的可选结果,而非记忆维护的默认机制。
论文正文表格呈现的是 LoCoMo 上的结果,摘要提到两个基准,但可核对的数值集中在 LoCoMo,因此跨基准的一致性仍是读者会关注的问题。附录说明类型化控制器返回的是模型自报数值,不假定为已校准概率,因此阈值型判据(如关系边 0.60、停止要求 evidence_sufficient 不低于 0.95)在不同模型或数据分布下的稳定性值得继续观察。检索存在独立上限(深度 8、访问节点 60、检查边 2400、Jev 调用 16、时间预算 15 秒),论文指出这些限制可能在证据不完整时终止检索,且时间预算是在操作之间检查、并非严格的抢占保证。此外,本次读取为全文,但表格与图示的具体呈现形式未在文本中完整展开,若需核对逐项数值仍应回到原文。
