DyadMem 基准发布:20 个模型在 Gold-Memory 问答上表现稳定,但 Full-Pipeline 问答大幅下降,并暴露低 Capture 召回、Recall 不完整与不安全删除问题
相关研究与后续进展核心概要
该工作提出 DyadMem 基准与 User-conditioned Relational Agent Memory(URAM)新定义,在同一多会话轨迹上联合标注用户侧记忆与 URAM,共 6 类记忆、3,065 个 episode、50,961 个 session、61,210 个 QA 实例,并设置 Gold-Memory 与 Full-Pipeline 两种问答;在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答稳定较强而 Full-Pipeline 问答大幅下降,量化结果还显示前沿大模型存在低 Capture 召回、Recall 不完整与不安全删除,且验证 URAM 有效性的实验对全部 20 个模型均呈正向效果。
Figure 1: DyadMem is a dual-domain, full-pipeline memory benchmark. Across multi-session user–agent interactions, Capture extracts current-session memories, Update reconciles them with the prior bank, Recall selects valid terminal- bank entries, and QA uses the selected evidence. The evolving bank contains shared episodic memory, user-side memory, and User-conditioned Relational Agent Memory (URAM); unlike general agent memory that transfers across users, URAM records how this particular agent should work with this particular user.
arXiv · 第 1 页深度剖析
提出 User-conditioned Relational Agent Memory(URAM)这一新定义,把“某个智能体应如何与该用户协作”的关系特异性记忆显式化,并与用户侧记忆在同一多会话轨迹上联合标注,形成 6 类记忆。 既有基准主要监督用户事实与偏好,或可跨用户复用的经验,使关系特异的智能体记忆保持隐含;DyadMem 将其作为独立标注对象纳入同一轨迹。 摘要说明联合标注沿同一多会话轨迹进行并得到 6 类记忆,属于基准定义与标注设计层面的证据。
构建了包含 3,065 个 episode、50,961 个 session、61,210 个 QA 实例的基准,具备 session 级 Capture 与 Update 金标注、query 级 Recall 支持,以及 Gold-Memory 与 Full-Pipeline 两种问答设置。 以往多数工作仅以长交互历史上的最终答案问答来衡量模型,评估不完整且不可靠;DyadMem 以双域、全流程的标注与两种问答设置替代单一最终答案评估。 摘要给出规模数字与标注类型,并明确两种 QA 设置,属于基准资源与评估协议层面的证据。
在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答一致较强,而 Full-Pipeline 问答大幅下降,这一差距支持其细粒度评估设计。 该结果说明仅看最终答案会掩盖全流程中的记忆环节问题,从而为分阶段评估提供实证依据。 摘要报告跨 20 个模型的对比结果,属于多模型基准评测层面的证据。
量化结果揭示即使前沿大模型也存在低 Capture 召回、Recall 不完整与不安全删除问题;进一步验证 URAM 有效性的实验对全部 20 个模型均观察到正向效果。 把记忆失败定位到 Capture、Recall 与删除等具体环节,并给出 URAM 有效性的跨模型正向证据。 摘要以“several quantitative results”与“rigorous experiment”描述,属于基准诊断与消融验证层面的证据。
启示与展望
该基准面向长期智能体记忆的研究与开发,适用于需要跨多会话与用户持续协作的智能体评测场景;其双域、全流程设计配合 Gold-Memory 与 Full-Pipeline 两种问答设置,可用于区分记忆环节与最终答案环节的表现,并借助 session 级 Capture 与 Update 金标注、query 级 Recall 支持定位具体失败环节。URAM 有效性的正向结果覆盖全部 20 个模型,提示该定义可作为关系特异记忆的评测与训练信号。
摘要未给出 Gold-Memory 与 Full-Pipeline 的具体分数、下降幅度、各模型 Capture 召回与 Recall 完整性的数值,也未说明不安全删除的判定方式与 URAM 验证实验的具体设计;此外,6 类记忆的划分依据、数据来源与领域覆盖范围在摘要中未展开。这些属于摘要层面的信息边界,读者若需据此复现或比较,仍需查阅原文的表格与实验设置。
