MIRROR 用多路径法定人数校验把 LLM 多智能体通信的中间人攻击成功率降到 0%
相关研究与后续进展核心概要
MIRROR 是一种通信层完整性原语,它把同一份规范化载荷复制到 k 条逻辑路由上,只有当严格多数路由报告相同摘要时才接受消息;在路由被攻陷比例 α<0.5 的假设下,该方法在 MMLU、HumanEval、MBPP 两个框架四种拓扑以及 MetaGPT 对生产 API 的部署中把攻击成功率降到 0%,且 LLM token 成本为 1 倍,而同一部署中 LLM-as-a-Judge 成本为 35 倍并在拓扑扫描中最多阻断 44.2% 的良性输出。
Figure 1: Overview of communication threats and the MIRROR defense. (A) Traditional attacks originate from a malicious or compromised sender, which is outside MIRROR’s scope. (B) AiTM attacks manipulate messages in transit via a third-party interceptor. (C) MIRROR replicates across routes and verifies quorum, recovering valid messages or blocking corrupted transmissions.
arXiv深度剖析
论文提出 MIRROR,一种通信层完整性原语,将单份规范化载荷复制到 k 条逻辑路由,仅当严格多数路由报告相同摘要时才接受消息。 与依赖语义验证(需额外推理且可能阻断良性输出)或传输层加密(当中介合法终止 TLS 时无效)的既有防御不同,MIRROR 在通信层用多路径法定人数来约束消息完整性。 摘要给出该原语的设计与在 α<0.5 路由攻陷界下的保证,并在 MMLU、HumanEval、MBPP 两个框架四种拓扑以及 MetaGPT 对生产 API 的部署中评估。
MIRROR 使用无密钥哈希,因此本身不认证任何内容,全部完整性来自诚实路由占多数的假设;摘要仅用于使见证路由保持常数大小,并在第二原像抗性下把恢复的载荷绑定到法定人数一致的值。 论文明确说明该原语不依赖密钥或认证标签,而是把安全归约到路由多数诚实这一条件,并给出 α<0.5 下的保证。 这是对原语安全假设的显式陈述,摘要中给出了路由攻陷界 α<0.5 以及向相关路由的扩展。
该保证可扩展到相关路由:此时关键量是最大共享失效组的规模,而不是路由数量;可用性与完整性在同一阈值退化,低于 α=0.5 时法定人数拒绝与丢消息对手无法阻断诚实流量。 论文把独立路由假设推广到相关失效情形,并指出完整性与可用性共享同一阈值,而非分别退化。 摘要陈述了相关路由下的扩展以及低于 α=0.5 时对法定人数拒绝和丢消息对手的不可阻断性。
在 MMLU、HumanEval、MBPP 的两个框架四种拓扑以及 MetaGPT 对生产 API 的部署中,MIRROR 在阈值以下把 ASR 降到 0%,LLM token 成本为 1 倍;同一部署中 LLM-as-a-Judge 成本为 35 倍,并在拓扑扫描中最多阻断 44.2% 的良性输出。 论文把通信层完整性与语义验证基线在攻击成功率、token 成本和良性输出阻断率上做了直接对比。 摘要报告了跨三个基准、两个框架、四种拓扑以及一次生产 API 部署的评估结果,并给出 1 倍与 35 倍 token 成本以及 44.2% 良性输出阻断率。
启示与展望
该结果面向具备多条逻辑路由的 LLM 多智能体通信部署,其完整性保证在路由攻陷比例 α<0.5 时成立,并可扩展到相关路由,此时关键量是最大共享失效组规模而非路由数量。摘要指出低于该阈值时法定人数拒绝与丢消息对手无法阻断诚实流量,因此可用性与完整性在同一阈值退化。评估覆盖 MMLU、HumanEval、MBPP 两个框架四种拓扑以及 MetaGPT 对生产 API 的部署,报告阈值以下 ASR 为 0%、LLM token 成本为 1 倍。
摘要未说明 k 的具体取值、路由如何构造、规范化载荷的具体形式,也未给出各基准与拓扑下的样本规模与统计细节。相关路由扩展中最大共享失效组规模如何度量、在真实部署中如何估计 α,摘要未展开。摘要提到 LLM-as-a-Judge 在拓扑扫描中最多阻断 44.2% 的良性输出,但未说明该比例随拓扑与任务的变化。由于本次阅读范围仅为摘要,上述细节需查阅原文方法、实验与附录部分。
