Sigma-Hunter 用 3,635 条 Sigma 规则微调 7B 模型,规则生成综合得分 8.17 超过最强通用基线 7.88
核心概要
该工作构建 Sigma-Hunter,将 3,635 条经校验的开源 Sigma 规则扩展为 7,663 条问答与分析师推理指令样本,并在源规则级别划分训练、验证与测试集以防泄漏;用 LoRA 微调 7B Mistral 与 Phi-4 后,在 188 条留出规则生成样本上按语法、字段一致性与语义判断评分,Sigma-Hunter-Mistral 综合得分 8.17,高于最强通用基线 7.88 与未微调 Mistral 的 4.61。
Fig. 2 : Different initial learning rates are evaluated for the Sigma-Hunter-Mistral model before the fine-tuning stage.
arXiv深度剖析
论文提出可复现流水线,把经校验的 Sigma 规则程序化转换为规则生成、规则解释、ATT&CK 映射、误报分析、威胁狩猎指引、日志源推理与规则精化等指令样本,并采用源规则级划分,使同一规则派生的所有样本只出现在一个划分中。 相对以往按样本随机划分的做法,源规则级划分避免了同一规则的不同任务同时进入训练与测试而抬高成绩;论文同时说明该做法只防止完全相同的规则泄漏,相近规则变体仍可能跨划分,相似度感知划分留待后续工作。 数据集统计明确:3,635 条源规则(433 条新兴威胁、130 条威胁狩猎、3,072 条通用检测)扩展为 7,663 条样本,按 80/10/10 划分为 6,130 训练、766 验证、767 测试;语料偏向通用检测规则,占源规则 84.5%。
论文训练了两个领域适配模型 Sigma-Hunter-Mistral(7B)与 Sigma-Hunter-Phi4,采用 LoRA 参数高效微调并导出为 GGUF/Ollama 包以支持本地推理。 与依赖云端托管模型服务的做法不同,该工作把能力打包进操作方可控环境,面向无法访问外部模型服务的断网或气隙环境;同时训练两个模型族以检验领域适配是否跨架构有效。 微调配置具体:基座为 4 位量化的 mistral-7b-instruct-v0.3,约 7.29B 参数,LoRA 覆盖全部 32 个 transformer 块的注意力与 MLP 投影,可训练参数 41,943,040(占 0.575%),序列长度 2,048 token,3 轮训练、批大小 4、梯度累积 4、8 位 AdamW 与余弦调度,按最低验证损失选检查点。
论文把多维结构化输出评估用于 Sigma 生成,测量语法有效性、近似字段一致性,以及由模型裁判给出的检测逻辑、完整性、规则选择性与日志源匹配,并报告微调带来的是语义质量提升而非仅格式改善。 论文指出语法有效性只是语义规则质量的弱代理:多个基线能输出结构合法、日志源匹配接近满分的规则,却在检测逻辑、完整性与选择性上差异明显;匹配模型对比显示 Sigma-Hunter-Mistral 从 4.61 升至 8.17,Sigma-Hunter-Phi4 从 6.82 升至 8.03。 定量基准为 188 条留出规则生成样本,所有模型使用相同提示;语义分数在成功判定的输出上取平均,有效判定数量随模型而异。论文以表 V 的留出样例说明差距:Sigma-Hunter-Mistral 同时保留 curl.exe 可执行文件约束与 file:/// 命令行模式,而 gpt-oss:20b 只保留协议处理器条件,两者语法有效且字段一致性均为 10,但后者选择性与综合分降至 4 和 5。
论文将 Sigma-Hunter 定位为分析师在环的辅助能力,而非自主部署系统:模型返回候选规则、简要解释、可能的日志源需求与误报考虑,分析师需对照本地遥测与 SIEM 字段映射核验、在历史数据上运行、调整过滤或白名单,再经检测即代码评审后才上线。 该定位把生成式输出放在人工问责链条之内,强调缩短从威胁描述到可评审检测产物的路径,而不是替代检测工程师的判断。 论文明确说明预期工作流仍由分析师主导,并指出模型裁判并非独立专家验证,人类检测工程师验证属于未来工作。
启示与展望
该结果面向在断网或气隙环境中工作的检测工程师与防御性网络操作团队,适用场景是分析师已提供威胁描述与部分检测线索(条件表达式、选择名、带修饰符的字段名、代表性字段值以及预期日志源产品、服务与类别)的引导式生成,而非仅凭威胁报告的无约束生成。论文把能力打包为 GGUF/Ollama 本地推理,使提示、威胁报告、日志与检测产物留在操作方可控环境内;预期工作流是分析师在环:核验本地遥测与 SIEM 字段映射、在历史数据上运行、调整过滤或白名单,再经检测即代码评审上线。后续方向包括引入人类分析师对生成规则的验证,并把 Sigma-Hunter 扩展到后端专用检测语言与运行模式。
语义分数由 gpt-oss:20b 作为裁判模型给出,论文说明这属于比较性语义评估而非独立专家验证,人类检测工程师验证仍属未来工作;规则选择性是语义判断,并非在带标注遥测上测得的实际告警选择性;字段一致性基于人工整理的遥测类别词典,属于近似信号而非权威 SIEM 模式校验器;日志源匹配在多数模型上接近上限,区分度有限;语料偏向通用检测规则(占源规则 84.5%),论文提示这可能限制在新兴威胁与威胁狩猎任务上的相对增益;源规则级划分只防止完全相同的规则泄漏,相近规则变体仍可能跨划分;语义指标在成功判定的输出上取平均,有效判定数量随模型而异。
