arXiv 2026年10月5日该工作提出 DyadMem 基准与 User-conditioned Relational Agent Memory(URAM)新定义,在同一多会话轨迹上联合标注用户侧记忆与 URAM,共 6 类记忆、3,065 个 episode、50,961 个 session、61,210 个 QA 实例,并设置 Gold-Memory 与 Full-Pipeline 两种问答;在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答稳定较强而 Full-Pipeline 问答大幅下降,量化结果还显示前沿大模型存在低 Capture 召回、Recall 不完整与不安全删除,且验证 URAM 有效性的实验对全部 20 个模型均呈正向效果。该工作提出 DyadMem 基准与 User-conditioned Relational Agent Memory(URAM)新定义,在同一多会话轨迹上联合标注用户侧记忆与 URAM,共 6 类记忆、3,065 个 episode、50,961 个 session、61,210 个 QA 实例,并设置 Gold-Memory 与 Full-Pipeline 两种问答;在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答稳定较强而 Full-Pipeline 问答大幅下降,量化结果还显示前沿大模型存在低 Capture 召回、Recall 不完整与不安全删除,且验证 URAM 有效性的实验对全部 20 个模型均呈正向效果。DyadMem 基准发布:20 个模型在 Gold-Memory 问答上表现稳定,但 Full-Pipeline 问答大幅下降,并暴露低 Capture 召回、Recall 不完整与不安全删除问题该工作提出 DyadMem 基准与 User-conditioned Relational Agent Memory(URAM)新定义,在同一多会话轨迹上联合标注用户侧记忆与 URAM,共 6 类记忆、3,065 个 episode、50,961 个 session、61,210 个 QA 实例,并设置 Gold-Memory 与 Full-Pipeline 两种问答;在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答稳定较强而 Full-Pipeline 问答大幅下降,量化结果还显示前沿大模型存在低 Capture 召回、Recall 不完整与不安全删除,且验证 URAM 有效性的实验对全部 20 个模型均呈正向效果。该工作提出 DyadMem 基准与 User-conditioned Relational Agent Memory(URAM)新定义,在同一多会话轨迹上联合标注用户侧记忆与 URAM,共 6 类记忆、3,065 个 episode、50,961 个 session、61,210 个 QA 实例,并设置 Gold-Memory 与 Full-Pipeline 两种问答;在 16 个开源权重与 4 个专有模型上,Gold-Memory 问答稳定较强而 Full-Pipeline 问答大幅下降,量化结果还显示前沿大模型存在低 Capture 召回、Recall 不完整与不安全删除,且验证 URAM 有效性的实验对全部 20 个模型均呈正向效果。