Mem++ 以非破坏性记忆取代写入时蒸馏,在 OrgMemBench 上比最强记忆基线高 8.0 至 13.1 分
相关研究与后续进展核心概要
作者提出 Mem++,一种非破坏性记忆框架,把每个文档连同日期与作者整体保存、写入时不调用生成模型,读取时只检索问题所问时间点之前的文档并融合词法与语义排序;在组织场景基准 OrgMemBench 上,它比最强记忆系统基线高 8.0 至 13.1 分(两种回答模型),用 gpt-4.1-mini 时总分最高、比 RAG 高 2.6 分,并在 LoCoMo 上取得最佳平均 LLM 评委分、在 LongMemEval-S 上排名第二,仅次于其实体图变体。
Figure 1: Conversational vs. organizational memory. Top: a single narrator restates their own facts, and LLM extraction at ingest keeps only the surviving fact. Bottom: different authors in an organization write the same fact, and an earlier decision may still hold.
arXiv深度剖析
Mem++ 把记忆设计从写入时蒸馏改为读取时选择:每个文档整体保存并附带日期与作者,写入阶段不调用生成模型。 多数记忆系统在写入时把文档压缩为事实、笔记或图边,从而在提问之前就固定了可回答的范围;Mem++ 不做这种压缩。 摘要以框架描述与对比陈述给出该设计,未给出实现细节或消融数据。
读取时 Mem++ 只检索日期不晚于问题所问时间点的文档,并融合词法与语义两种排序。 系统不覆盖旧版本,而是保留旧版本并把版本选择留给回答模型,这与覆盖旧版本的记忆系统形成对照。 摘要陈述了检索与排序融合机制,未报告检索精度或时间过滤的单独评测。
在组织场景基准 OrgMemBench 上,Mem++ 比最强记忆系统基线高 8.0 至 13.1 分,覆盖两种回答模型。 该提升是在组织长期文档场景下相对既有记忆系统基线测得的,而非仅与朴素检索比较。 摘要报告了跨两个回答模型的分数区间,未给出各模型的具体分数、样本量或统计检验。
用 gpt-4.1-mini 时 Mem++ 取得最佳总分,比 RAG 高 2.6 分;在 LoCoMo 上取得最佳平均 LLM 评委分,在 LongMemEval-S 上排名第二,仅次于其实体图变体。 结果同时覆盖组织基准与两个通用长期记忆基准,说明该设计不限于单一评测集。 摘要给出相对 RAG 的 2.6 分差与两个基准上的排名,未报告绝对分数、评委设置或置信区间。
启示与展望
该工作面向组织场景中跨月累积、以新文档形式修订决策的长期记录,适用于文档带有日期与作者、且提问带有时间指向的设定。它使回答模型能够在读取时自行判断哪个版本在当时生效,而不是接受写入阶段已固定的答案范围;对需要审计决策沿革、或需要区分同一主题不同时期版本的团队,这一取向可直接使用。摘要提到基准评测代码已公开,便于在 OrgMemBench 及同类长期记忆基准上复现与扩展。
摘要未给出各回答模型的具体分数、OrgMemBench 的规模与构成、时间过滤与排序融合各自的贡献,也未说明 LLM 评委的评分设置。LongMemEval-S 上排名第二、仅次于其自身实体图变体,提示不同记忆组织方式各有适用条件,何种场景更适合实体图变体仍是开放问题。此外,写入时不调用生成模型意味着存储与读取成本随文档量增长,其代价在摘要中未量化。
