跳到主要内容
返回时间线
arXiv来源发表:

Gated Memory 在抽取前设置准入闸门,在 LoCoMo-10 上以相同检索与生成取得 +2.6% 相对准确率提升

核心概要

该工作提出 Gated Memory,一个插入对话与存储之间的记忆形成层:在抽取之前用话语级准入闸门评估候选事实,并对准入事实做实体范围分类与条件式富化,同时以当前轮次为事实来源、历史轮次仅作指代消解参考。在 LoCoMo-10 上,检索、生成与评测均不变,仅改变进入记忆库的内容,LLM 评判准确率整体相对提升 2.6%,其中 Single-Hop +4.4%、Open Domain +3.3%、Temporal +1.7%,Multi-Hop 下降 4.2%。

Source-provided article image: Gated Memory: Admission-Controlled Memory Formation for Conversational AI
Figure 1 ·

Figure 1: The Gated Memory pipeline. Every candidate fact passes through an utterance-level admission gate. Admitted facts are scope-classified and conditionally enriched before being passed to the memory backend.

arXiv

深度剖析

论文把长期对话记忆的“形成阶段”识别为独立且此前少被系统处理的失效点,并刻画三种失效模式:反应式准入、缺少富化、以及上下文的不可恢复丢失。 既有系统(MemGPT、mem0、A-MEM 等)主要投入检索、去重、生命周期管理与情景/语义分类等存储后操作,默认“进入存储的事实值得存储”;该工作把问题前移到事实首次写入存储的那一刻。 论证以结构性分析为主,用“租来的 SUV”与“自己拥有的 SUV”产生同一三元组、以及既有框架在 LoCoMo 上产出的“Has favorite memories”等空泛条目为例,说明这些条目能通过去重、无过期信号而存活并占据检索高位。

提出话语级准入闸门,在抽取之前依据完整原始话语判断候选事实是否值得存储,并把对话拆成“当前交换”与“只读参考历史”,使形成过程跨轮次幂等。 生命周期推理问的是事实是否与已存知识冲突,且作用于已抽取的三元组;准入控制问的是事实是否值得存储,作用于上下文尚完整的话语,因此能保留“拥有还是租用”这类下游无法恢复的信号。 准入准则为三条:编码个性化关系、编码半稳定用户属性、具备跨会话可复用性;拒绝瞬时状态、泛化情绪反应与含糊非事实内容。闸门在十段对话中处理 5,882 条话语,准入 5,527 条(94.0%),拒绝 355 条(6.0%),拒绝主要为含糊情绪表达、程序性轮次与瞬时情境指涉。

把形成形式化为结构化抽取而非二值过滤:准入内容被拆成原子事实,各自赋予六类形成类别之一或多类、直接陈述与推断的来源标签、以及适用条件范围,并在形成时对相对时间与空间指代做锚定。 情景—语义区分通常是在内容已存储之后做事后归类;该工作在话语完整时确定类别、来源与适用范围,因为区分“直接陈述”与“顺带推断”的信号属于原始话语而非三元组。 以“gift ideas for my son”同时产出 persona 事实与 procedural 事实、“find a hotel with an onsen, and remember I’m vegetarian”产出受限偏好与持久 persona 属性为例;来源标签决定后端置信度,直接陈述可作持久语义存储,推断事实暂存待佐证。

引入四类实体范围分类(USER_PII、INTERNAL、EXTERNAL、GENERIC)来约束条件式富化,并施加接地约束:不得断言评估窗口内不存在的实体或关系,同时保留用户话语的原始语言。 统一富化会把个人信息未经同意送往外部服务,零富化则放弃语义深度;范围分类在形成时决定是否允许外部知识源,接地约束则把三元组抽取中“自信断言无支撑实体”的隐性失效转为有界、可审计的决策。 USER_PII 不做富化,INTERNAL 仅用内部元数据、不发起外部调用,EXTERNAL 在语义必要时做外部接地,GENERIC 使用参数化知识或不富化;示例为仅含“he is seven”而无儿童指代时,产出“用户的孩子七岁”而非虚构一个儿子。

启示与展望

该框架面向个性化对话助手的长期记忆写入环节,作为可插入现有记忆后端的形成层使用,检索与生成保持不变,因此适用于希望在不改动下游组件的前提下改善记忆质量的部署。它明确针对“事实首次写入存储”这一时刻,准入准则围绕个性化关系、半稳定用户属性与跨会话可复用性设计,拒绝瞬时状态、泛化情绪与含糊非事实内容。范围分类与条件式富化面向需要隐私约束的场景:USER_PII 不富化,INTERNAL 仅用内部元数据,EXTERNAL 在语义必要时才做外部接地。作者指出,在高比例无关上下文的生产环境中,该闸门的收益可能比在 LoCoMo-10 上更大;域自适应阈值与知识图谱接地被列为自然延伸。

准入闸门的效果依赖底层 LLM 提示的质量,对抗性或含糊话语可能在形成时被误分类,且与下游去重不同,形成错误在事实形成后无法被检出。评测在 LoCoMo-10 上进行,该数据的话语带有非典型的高情绪密度,因此跨领域、跨语言与任务型部署的泛化仍需实证;6.0% 的拒绝率被视为保守下界,任务型部署预计会有更高的过滤率。Multi-Hop 的 4.2% 回退被归因于独立事实评估固有的精确率—召回率权衡,链式感知、建模事实间依赖的准入被列为未来工作。富化阶段对 EXTERNAL 范围事实引入外部知识调用,带来延迟与时效性信息可能过时的风险。此外,准入与富化各自的贡献尚未拆分,被留作未来工作。

来源