跳到主要内容
返回时间线
arXiv来源发表:

当智能体看起来像信标:MCP 流量对 NIDS 的规避

核心概要

该研究在基于 Docker 的受控测试床中,用十一种数学定义的流量画像(含 MCP 任务驱动、编排、突发、抖动、User-Agent 伪装等)在三种 TLS 条件(不透明 TLS、TLS 检查、明文)下评估 Suricata 签名匹配与 RITA 行为信标评分,发现 MCP JSON-RPC 流量在 ET Open 规则集下几乎不产生告警、RITA 信标评分一致为 0.0,且抖动注入与 User-Agent 伪装未改变传感器输出,据此提出 Agent-Native ALPN 与模式感知状态化检测规则作为改进方向。

Source-provided article image: When Agents Look Like Beacons: NIDS Evasion by Model Context Protocol Traffic
Fig. 1 ·

Fig. 1: RITA beacon scores across representative traffic profiles. The horizontal dashed line at 0.85 marks the CISA operational detection threshold, shown as a reference point from a calibration run using a known C2 packet trace [ 7 ] . All MCP profiles (P4–P10) score 0.0. The synthetic C2 profiles (P2 and P3) also score 0.0 due to a RITA boundary condition explained in Section V-C .

arXiv

深度剖析

在不透明 TLS 下,传感器只能看到 TLS 握手、IP、端口与流级指标,Zeek 从 ClientHello 提取的 JA3 指纹为 cf712d3b01ab6bfd22ca983b4748ab2f,与 Abuse.ch SSLBL 威胁情报比对为零恶意关联;在 TLS 检查下,mitmproxy 终止并重加密会话,传感器可看到完整 MCP JSON-RPC 载荷,包括 initialize、tools/list、tools/call 等方法名及嵌套参数中的终端命令、SQL 查询与本地文件路径。 此前对 MCP 的讨论多集中在协议与威胁分类,这里给出了不同 TLS 可见性条件下传感器实际能观测到什么的实测对照。 基于容器化测试床中三种 TLS 条件的受控测量,JA3 指纹与威胁情报库做了交叉比对。

Suricata 在 44,236 条 ET Open 规则下对所有 MCP 画像在不透明 TLS 与 TLS 检查条件下均产生零条可操作告警;唯一例外是明文条件下 P6 与 P7 平均每次运行 0.25 条告警,经人工 PCAP 检查确认是流量生成器缺少请求头导致的通用 HTTP 协议异常,而非 C2 或恶意软件检测,任何运行中都没有 C2 类别或数据外泄规则 ID 触发。 把“MCP 是否会被签名型 IDS 误报或漏报”从推测变成了在完整未修改规则集下的实测计数。 每个画像-条件组合重复 N=5 次、每次 60 秒持续流量,附录表 II 给出逐画像告警均值。

RITA 对全部十一种画像在全部 TLS 条件下都给出 0.0 信标评分,包括高度周期性的 MCP 编排画像 P5 与合成 C2 画像 P2、P3;对 P2、P3 而言,每次 60 秒运行在 Zeek conn.log 中产生的唯一源-目的连接记录少于 12 条,低于 RITA 计算稳定四分位数所需的最小连接数,因此报告 0.0 而非不确定值,这是 RITA 统计模型的已知边界条件。 揭示了行为信标评分工具在低连接数场景下的边界行为,并把它与真正的检测缺口区分开来。 基于 Zeek conn.log 的连接计数与 RITA v5.x 的评分输出,图 1 中 0.85 参考线来自使用已发表 C2 数据包的单独校准运行,并非测试床中任何画像的观测分数。

对 MCP 画像 P4 至 P10 而言,0.0 评分反映真实检测缺口:由 LLM 推理延迟驱动的对数正态到达间隔产生高 Bowley 偏度与高 MAD 值,而 RITA 的归一化模型是在低偏度、低 MAD 的周期性恶意软件上校准的,高偏度与高方差把归一化输出推向 0.0 而非 1.0;由于基线 MCP 画像本已产生 0.0 评分与零告警,P7 抖动注入与 P9a User-Agent 伪装未带来可测量的传感器输出变化。 说明 MCP 的默认时序形态本身落在 RITA 时序启发式的检测参数空间之外,主动规避在该配置下并非必要。 基于图 2 所示到达间隔分布的概念密度对比,以及 P7、P9a 与基线画像的传感器输出对照。

启示与展望

该结果适用于作者所搭建的容器化测试床范围:Suricata v8.x 搭配完整未修改的 ET Open 规则集、Zeek v6.x 加社区 JA3/JA4 脚本、RITA v5.x,以及不透明 TLS、TLS 检查与明文三种可见性条件。它面向企业网络防御者、MCP 规范维护者与 IDS 厂商,用于说明在何种部署条件下 MCP 远程工具调用不会触发所测传感器;作者提出的 Agent-Native ALPN 与模式感知状态化检测规则,是下一步可在网关与规则集层面推进的方向。

读者仍会关注:N=5 次重复对连续效应量的估计能力有限,作者也将其定位为对检测缺口的初步刻画;RITA 在连接数低于阈值时报告 0.0 的边界条件意味着周期性画像的评分需要结合连接计数解读;图 1 中 0.85 参考线来自单独校准运行而非测试床观测值;此外,跨更多 IDS 配置、规则集与真实流量规模的验证仍待展开。

来源