四种网络流量生成模型被证明会泄露训练数据:成员推断成功率最高达88%,网络标识符可被完整还原
核心概要
该研究为合成网络流量提出了一套覆盖成员推断攻击、数据抽取攻击和网络特有攻击(标识符、属性、拓扑)的隐私度量体系,并在四种代表性生成模型(NetShare、NetDiffusion、TrafficLLM、NetSSM)和五个数据集上系统评估,发现在攻击者仅有黑盒访问且模型仅做最小训练的保守条件下,成员推断的TPR@FPR≤0.01最高可达0.88,网络标识符的还原率最高可达100%,且匿名化与DP噪声两类缓解手段各自只能覆盖部分风险并伴随效用损失。
Figure 1: Pipeline of splitting each dataset into non-training, training and auxiliary data.
· 第 4 页深度剖析
论文提出并落地了一套面向合成网络流量的多维隐私度量:成员推断攻击(PCAP级,报告TPR@FPR≤0.01与AUC-ROC)、数据抽取攻击(以连续10个原生表示单元逐字匹配训练数据为可抽取判据),以及网络特有攻击,后者细分为网络标识符(输出覆盖率与输出置信度)、敏感网络属性(TTL、IP ID、ToS、窗口大小、控制标志、TCP数据偏移、流大小、包大小,用归一化EMD衡量)和网络拓扑(节点重叠、边重叠、节点度分布EMD)。 此前对合成网络流量的隐私评估主要依赖成员推断攻击作为唯一指标,而网络流量中除成员关系外还包含标识符、指纹属性与拓扑等敏感信息;该工作把这些网络语义层面的风险显式拆解为可计算的指标,使数据集所有者能看清“泄露的是什么、是否敏感、泄露到什么程度”。 度量定义在正文中给出明确公式(覆盖率与置信度),拓扑部分限定取按总字节排序的前100条通信流构建无向图,属性部分用归一化EMD;攻击仅在模型架构与输出允许时执行,论文用一张表明确标注了每个模型实际执行的攻击类型。
在最不利于攻击者的设定下(仅黑盒访问、除NetDiffusion外模型仅训练1个epoch),隐私泄露依然显著:MIA在五个数据集中的四个上AUC≥0.80,TPR@FPR≤0.01最高达0.88;NetSSM最脆弱,TrafficLLM次之,NetDiffusion明显更低。 该结果说明隐私风险并非仅由过拟合驱动,即便在最小训练与黑盒条件下,字节级(NetSSM)与十六进制(TrafficLLM)编码仍比比特级图像编码(NetDiffusion)泄露更多成员信息,作者将其归因于编码粒度与序列建模能力的差异。 结论基于四个生成模型与五个数据集的交叉对比,并报告了AUC与严格FPR下的TPR两类指标;作者同时指出MIA效果随数据集变化,可能与训练样本与非训练样本的相似程度有关,属于假设性解释。
数据抽取攻击对自回归模型更有效:NetSSM与TrafficLLM在除CIC外的四个数据集上可抽取率≥0.4,部分数据集超过0.8,而NetDiffusion未表现出可抽取性;抽取集中在位置1–9与27–33,对应MAC与IP地址等标识符字段。 该攻击仅用流量类型标签(不含任何训练流量)作为提示即可成功,说明攻击者无需掌握训练数据也能高比例还原训练样本;同时揭示了分类/标识符类字段比连续值字段更容易被记忆,为理解网络头部“混合类型”结构下的记忆模式提供了位置级证据。 可抽取性定义为生成序列中存在至少10个连续原生表示单元与训练数据逐字一致;位置分析以NetSSM的字节位置曲线呈现,TrafficLLM的对应曲线放在附录,作者据此把高抽取率位置映射到以太网层字段。
多数生成模型会泄露网络标识符与敏感网络属性,NetSSM还额外泄露网络拓扑:源IP置信度在五个数据集中的四个上超过0.8,覆盖率在部分数据集超过0.35;无缓解时TTL、ID、流大小、ToS的归一化EMD可低至0.10或更低;NetSSM在MAC层拓扑的节点与边重叠率可达1.0,即完整拓扑重建。 论文进一步发现高频出现的标识符(训练中出现超过1000次的源IP)被记忆的概率显著更高,且拓扑中重叠的节点多为高度数枢纽节点,意味着重要服务器、核心路由器等关键基础设施恰恰是暴露风险最高的一类实体。 标识符结论基于覆盖率与置信度两个互补指标;属性泄露基于表4中四个模型逐属性的归一化EMD对比;拓扑结论基于图重叠指标与节点度分布EMD,作者解释MAC层泄露更高是因为MAC地址空间通常小于IP地址空间。
启示与展望
该研究面向多流PCAP级合成网络流量,评估对象是四种代表性生成模型(NetShare、NetDiffusion、TrafficLLM、NetSSM)与五个数据集(IoT、SR、VNAT、USTC、CIC),攻击设定以黑盒加最小训练为保守基线,并额外考察白盒访问、训练轮数与数据规模的影响。它适用于需要决定“合成流量能否对外发布、以何种粒度发布”的数据所有者与网络运营方:在可信环境内部可优先保真度,对外共享则需更强保护。缓解评估集中在NetSSM,覆盖完全匿名化、假名化、前缀保留三种匿名化策略与ε=0.1、ε=1两档DP噪声,并区分多流与单流两种生成设置。
仍有若干问题值得持续观察。其一,MIA效果随数据集波动,作者提出训练样本与非训练样本相似度可能是原因,但这属于假设而非已验证机制。其二,网络属性泄露用归一化EMD衡量,作者说明因缺乏指纹攻击的ground truth而采用分布距离替代,因此该指标反映的是可利用性而非实际攻击成功率。其三,缓解评估只针对NetSSM,其他模型上的隐私-效用权衡是否呈现相同排序尚不清楚。其四,匿名化后网络属性推断有效性有时反而上升,说明不同攻击类型之间并不必然同向变化,单一指标可能给出片面印象。其五,多流设置下缺少下游任务标签,因此任务准确率只在单流设置下评估,多流场景的效用代价未被量化。
