MemLeak 在共享向量记忆的多租户智能体中测得 70–100% 跨用户泄漏,硬性归属门控将污染恢复到 1.00/5
相关研究与后续进展核心概要
该工作形式化多租户 AI 智能体记忆中的跨用户可采性失败,在稀疏 TF-IDF 与生产级 MiniLM 检索下开展六项实验及后续消融,发现池化同团队检索下非对抗性附带泄漏达 70–100%、对抗性构造记忆取得 90–100% 的 top-k 命中,端到端响应污染最高 5.00/5 且常被评得与干净回答同样或更有帮助,而三种缓解中只有检索后硬性归属门控在两个生成模型上稳定恢复到 1.00/5 干净基线,代价约为每查询 1.4 ms 延迟。
Figure 1: MemLeak architecture. Alice’s memories and Bob’s query co-exist in a shared vector store; cosine top- k k retrieval pulls Alice’s memories into Bob’s context without an ownership check (dashed red path), constituting a cross-user admissibility failure (§ 3 ). Dashed bordered boxes mark the three mitigation intercept points: M1 (metadata filtering at the store), M2 (ownership-aware embeddings), and M3 (post-retrieval ownership gating).
arXiv深度剖析
共享嵌入空间本身构成跨用户泄漏面:用户查询可通过普通余弦相似度检索到语义相邻的他人记忆,无需任何漏洞利用、提示注入或代码改动。 此前关于记忆可信性的工作(如 Tan 等、Wu 等)把记忆视为单用户信任边界,只讨论用户自身记忆如何影响自身任务;该工作把问题扩展到多用户情形,即 Alice 的记忆进入 Bob 的会话。 E1 存在性证明在池化检索下两种配置均出现系统性泄漏(Config A 100%,Config B 70%,95% Wilson 区间 [40%,89%]),而分区检索下两者均为 0%,构成对照。
泄漏严重程度不随组织距离或全局嵌入质心相似度等直觉风险信号单调变化,相似度是糟糕的可采性代理。 该工作提出跨用户可采性失败的形式化定义与泄漏指标(LR、MCR、分数差、XLR、探索性 Resonance Index),并报告 95% Wilson 置信区间。 E2 中 T1、T2 名义泄漏率(90%)高于质心相似度最高的 T0(70%,相似度 0.570),但 70% 与 90% 的 Wilson 区间大幅重叠,作者明确将该细粒度排序视为提示性而非已确立;稳健结论是跨公司对照 T3 以 10% 泄漏率(区间 [2%,40%])清晰分离。
对抗者只需知道受害者的领域与角色、无需查询级或模型内部信息,即可用构造记忆取得接近 oracle 的检索优势。 E3b 显式设定攻击者知识并设置递进基线(有机、领域关键词袋、逐查询关键词、构造桥接、逐字复制 oracle),把构造方法的边际贡献与单纯词汇重叠区分开。 Config B 下命中率随假定知识单调上升:10%(有机)→40%(关键词袋)→80%(逐查询关键词)→90%(构造桥接)→100%(逐字复制 oracle);仅凭领域词汇的关键词袋已达 40%,说明部分优势来自共享词汇。
泄漏记忆会实质污染下游回答,且污染回答常被评得与干净回答同样或更有帮助,因此常规回答质量监控无法发现该失效。 该工作在静态注入与完整检索-生成两条记忆路径上评估 Gemini 2.5 Flash 与 Claude Sonnet 4.5,并用人工标注试点校验 LLM 评判。 E4 中污染从干净基线 1.00 升至 2.67–5.00;检索路径加 Gemini 2.5 Flash 达最高 5.00/5,Claude Sonnet 4.5 在两条路径均为 4.67/5;E0 人工一致性试点在干净对照与有用性上 MAE 0.53、在污染上 MAE 0.79,且唯一分歧方向保守,故污染数值被视为下界。
启示与展望
该工作面向池化向量存储或范围被有意放宽的部署模式(欠范围元数据过滤、团队/角色范围检索、共享项目命名空间、HR/财务/安全等按策略共享的流程),而非完全缺失访问控制的平凡情形;严格用户分区作为 ACL 基线在其实验中把附带泄漏降至 0%。结果适用于使用嵌入相似度检索、以软元数据表达归属的多租户个人智能体记忆,并提示系统设计者应联合评估检索架构与生成模型选择。可据此推进的方向包括:在更大样本与真实企业记忆分布上验证,评估更大更多样的企业嵌入模型,开展跨模型评判-生成配对与独立人工裁定,以及把检索后硬性归属门控作为可部署的低成本默认防线。
细粒度排序(如 E2 中 T1/T2 高于 T0、E5 中 Resonance Index 在 T0–T2 间的次序)在每层少量查询下 Wilson 区间重叠,应视为提示性而非已确立;记忆与查询为手工构造的固定夹具,其对企业真实记忆分布、词汇重叠模式与查询措辞的代表性尚未验证。E4/M3 的污染与有用性由与生成器同族的模型自评,人工一致性试点样本很小且在污染维度一致性较弱,跨模型评判-生成配对仍属未来工作。缓解方案为概念验证实现,多数实验的检索路径使用内存余弦搜索,仅延迟基准使用生产 pgvector/HNSW 基础设施且为单一过取因子;命名空间偏移变体在测试中不可行,需完整的用户条件化编码器训练才能恰当评估。E6 的负结果(比特 5–8 错误率达 100%)表明可控吞吐的信道尚需结构化纠错编码,该文未声称已实现此类信道。此外,该文仅研究嵌入相似度检索,未实证评估基于 LLM 的记忆选择等替代机制。
