跳到主要内容
返回时间线
arXiv来源发表:

SERA-IDS用结构化经验检索让7B–14B小模型在NetFlow入侵检测上把宏F1从最低1.94%提升到最高87.66%

核心概要

SERA-IDS把训练阶段的分类错误转成带特征条件、目标类别、置信度与来源的结构化经验规则,经置信度门控存入冻结的经验库,推理时检索最多五条类别多样的规则并与查询流做条件比对,作为证据交给本地部署的小语言模型决策;在NF-BoT-IoT与NF-ToN-IoT上,Llama 3.1、Phi-4:14B、Qwen2.5:7B的宏F1由零样本的1.94%–11.66%提升至69.50%–87.66%,且无需微调或付费托管推理。

Source-provided article image: SERA-IDS: Structured Experience Retrieval-Augmented Intrusion Detection with Small Language Models
Fig. 1 ·

Fig. 1: Overview of the proposed SERA-IDS framework. (a) Offline rule construction from misclassified training flows, including error analysis, confidence-based admission, and structured rule storage. (b) Online classification using feature representation, diversity-aware top-five retrieval, condition verification, and SLM-based decision reasoning.

arXiv

深度剖析

提出以分类错误为驱动、带置信度门控的结构化经验规则框架:错误分析代理只对误分类流生成规则,规则包含行为描述、数值与类别条件、混淆类别信息、工具置信度与来源,置信度由滥用信誉式评分、恶意/未知/良性判定、威胁脉冲式活跃度评分与攻击技术描述相似度等信号的平均强度与一致性计算,达到阈值者进入活跃经验库,其余进入管理队列。 相较自由文本经验,规则保留了可度量的特征条件与混淆类别信息,使经验成为可检索、可条件核验的混合对象,而非仅靠语义相似度匹配的散文式说明。 构建结束时活跃库含7,326条(NF-BoT-IoT)与10,664条(NF-ToN-IoT)规则,另有56与3,043条低置信候选进入管理队列;规则生成速率在后期普遍下降,提示对反复出现的错误覆盖度上升。

提出类别多样的top-five检索与条件核验机制:先用FAISS检索候选池,再对每个类别保留最高相似度规则并取相似度最高的若干类别,同时把查询流与检索到的数值/类别条件逐项比对,生成特征级证据,与流和规则一并交给决策SLM。 把检索单元从单条自由文本经验改为五条带显式条件的结构化经验,并让条件证据作为上下文支持而非确定性投票参与最终决策。 在固定决策模型的前提下,SERA-IDS相对MA-IDS在NF-BoT-IoT上增加16.86、39.70、20.11个点,在NF-ToN-IoT上增加19.86、72.36、4.77个点;宏F1在全部模型与数据集上从零样本经MA-IDS到SERA-IDS单调上升。

验证了经验库可跨模型复用:经验库由Llama 3.1构建后冻结,供Llama 3.1、Phi-4:14B、Qwen2.5:7B三个本地可部署SLM共用,全程不微调、不更新参数、温度为零。 说明结构化外部记忆的效果不依赖构建它的模型,Phi-4在NF-ToN-IoT上以87.66%宏F1超过构建库的Llama 3.1,也超过此前GPT-4o的85.22%(但本次为十类、此前为九类)。 三个模型在NF-BoT-IoT的宏F1分别为86.46%、69.50%、83.51%,在NF-ToN-IoT分别为84.16%、87.66%、83.37%;SERA-IDS下宏召回稳定在94.78%–97.14%,宏精度在54.36%–79.87%之间。

给出精度—召回与延迟—性能的权衡刻画:相对MA-IDS,SERA-IDS对Llama 3.1与Qwen2.5降低宏精度1.12–6.62个点,但提升宏召回17.22–34.87个点;延迟上Llama 3.1与Qwen2.5低于0.4秒/流,Phi-4需3.05–3.45秒/流。 把结构化经验带来的收益与代价同时量化,指出召回提升可能来自五条类别多样规则让模型接触更多候选类别,但该研究未把检索宽度与规则表示分离。 延迟为端到端本地推理测量而非线速IDS吞吐;Phi-4在NF-ToN-IoT取得最高宏F1、在NF-BoT-IoT取得最低,说明其延迟并未换来稳定更好的检测。

启示与展望

该结果面向以NetFlow流记录为输入、类别集合固定的多分类入侵检测场景,适用于先由轻量检测器预筛流、再由SLM做分析性判定的部署形态,而非线速包级检测。经验库在测试前冻结,测试标签仅用于计算指标,因此方法针对的是训练分布内的已知攻击类别;构建与推理使用同一套14个数值特征加类别与协议信息的表示,规则条件也基于该表示。经验库由Llama 3.1构建后可被Llama 3.1、Phi-4:14B、Qwen2.5:7B共用,说明结构化规则可作为跨模型复用的外部记忆,适合希望本地执行、控制数据流向并保持成本可预测的安全团队。

读者仍需留意:该比较同时改变了规则表示与检索宽度,因此无法从现有结果判断结构化条件与top-five检索各自的贡献;置信度信号来自离线合成测试床而非实时威胁情报,其外部效度有待进一步观察;延迟为端到端本地推理测量,未覆盖线速吞吐;未来工作提到组件消融、未见攻击与经验库鲁棒性尚未展开。此外,正文中的公式与部分配置数值在文本中未完整呈现,若需复现具体阈值与检索参数,应查阅原文图表。

来源