跳到主要内容
返回时间线
arXiv来源发表:

KaliBench 用 8504 条查询–命令对测出:LLM 选对工具容易,写对参数才是瓶颈

核心概要

研究者构建了 KaliBench——一个面向 Kali Linux 无 schema 自然语言到命令行(NL–to–CLI)的细粒度基准,含 8504 条经 LLM 校验、沙箱执行与人工复核的查询–命令对,覆盖 1642 个工具、23 个能力维度与五个安全阶段;在无限制、受限、提示三种设置下评测 24 个开源模型配置,发现工具选择在受限设置下平均从 72.0% 升至 95.2%,而可选参数 F1 仅小幅提升,提示设置才把可选参数 F1 从 45.1% 提到 87.8%、精确正确率从 22.3% 提到 73.1%,说明参数构造是主要瓶颈;用该基准的免运行时可验证奖励做 SFT 与 RLVR,使 8B 模型平均总分提升 7.5 个百分点。

AI-generated editorial illustration: KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

深度剖析

KaliBench 把自然语言安全请求到可执行 Kali 命令的翻译拆成工具选择、可选参数(别名感知的 flag–value)与位置参数三部分,并给出组件级指标(Tool Accuracy、Optional-Argument F1、Positional-Argument F1、Total Score、Exact Correct)。 此前网络安全基准多以选择题或结构化问答考察知识(SecEval、CyberMetric、CyberBench、SECURE、CS-Eval、SecBench、CTI-Bench),或以 CTF 端到端任务考察智能体(CyBench、NYU-CTF Bench、DefenderBench),而通用函数调用基准(BFCL、ToolSandbox、StableToolBench、HammerBench)假设工具由 JSON schema 显式定义;KaliBench 针对的是无 schema 的真实 CLI 场景,模型必须自行推断工具与语法。 数据来自 Kali Linux 官方工具手册(2372 个工具的结构化 Markdown),经 Qwen3-Max 生成 27.7K 候选,再经 LLM 校验(首轮过滤 53.8%)、Docker 沙箱执行验证(再过滤 11.95%)与人工复核(再剔除 4.9%),最终保留 8504 条,占原始生成量的 30.7%。

在三种信息量递增的设置下,工具选择与参数构造是两类不同难度的任务:受限设置主要解决“用哪个工具”,提示设置主要解决“命令怎么写”。 该分解使失败可归因到具体组件,而端到端智能体评测中规划、环境交互、观测解读、工具调用与错误恢复混在一起,难以定位。 24 个开源模型配置的平均值显示,从无限制到受限,Tool Accuracy 由 72.0% 升至 95.2%,但 Exact Correct 仅由 22.3% 升至 28.3%;从受限到提示,Optional F1 由 45.1% 升至 87.8%,Positional F1 由 61.1% 升至 90.1%,Total Score 由 59.4% 升至 90.8%,Exact Correct 由 22.3% 升至 73.1%。附录 H 的差值分析进一步显示,受限相对无限制的 Exact 增益平均仅 5.9 个百分点,而提示相对受限的 Exact 增益平均达 44.8 个百分点。

免运行时的可验证奖励可用于训练:以 RedSage-Ins 为骨干的 8B 模型经 SFT、GRPO、SFT+GRPO 三种后训练后,平均总分分别达到 77.4、76.9、79.2,其中 SFT+GRPO 在全部开源模型中平均总分排第三,仅比 DeepSeek-V3.2† 低 1.0 个百分点。 奖励直接由组件级指标(工具名、位置参数、别名感知的可选参数)与精确匹配构成,且因真值命令已在数据构建阶段通过沙箱执行验证,奖励无需执行模型输出即可计算,从而支持不依赖运行时的强化学习。 训练使用 LoRA 在单张 H200 上完成,SFT 耗时 32 分钟,GRPO 从骨干直接训练耗时 28 小时、从 SFT 检查点初始化耗时 17 小时;论文报告 SFT 与 RLVR 使 8B 模型在三种评测模式下的平均 Total Score 提升 7.5 个百分点。

基准对更强系统仍未饱和,且查询措辞会影响表现。 论文额外评测了闭源模型与脚手架系统,并系统考察了改写、口语化、杂乱三类查询变体,这在同类 CLI 基准中不常见。 在 5000 条无限制设置查询上,GPT-5.6-Sol 全量 Exact Correct 为 61.68%(回答 4988 条),Codex(GPT-5.5)为 51.68%(回答 4633 条),Claude Opus 5 为 44.02%(回答 3675 条,回答集内为 59.89%),均高于最强开源模型 GLM-5.2 的 41.32%;查询变体方面,改写影响很小甚至在无限制与受限下略有提升,口语化带来小幅一致下降,杂乱查询降幅最大(提示模式下仍下降 1.07 个百分点)。

启示与展望

该基准定位于单轮、文档接地的自然语言到 CLI 命令翻译,适用于需要在本地部署、不便把查询与目标信息交给闭源 API 的安全场景;其组件级指标与免运行时奖励为后续工作提供了可复用的评测与训练接口,作者也指出未来可扩展到多步工作流、检索增强的工具使用与环境感知评测。

读者仍需留意:真值命令来自构建时的 Kali 工具手册,上游文档随版本增删或改义可能使部分规范化命令过时;手册本身偶有不一致(如 regtree 的 -V 同时被记为 --no-values 与 --version,Impacket 系列存在 -aesKey 这类非常规短选项),使完全确定性的规范化只能是近似;别名感知评分依赖半自动抽取的别名组,难以覆盖全部历史或社区变体;LLM 校验虽经人工抽查确认残余错误有限,但仍非完美。此外,闭源系统的回答覆盖率差异(Claude Opus 5 仅回答 73.50%)提示供应商侧安全限制会影响可用性,这一因素如何影响实际部署仍需观察。

来源