跳到主要内容
返回时间线
arXiv来源发表:

CVE2AP 用大模型从 CVE 描述自动生成 PDDL 攻击路径,GPT-5.5 达 86.9% 语法正确率与 93.1% 语义正确率

相关研究与后续进展

核心概要

该工作提出 CVE2AP,用结构化提示与规划器错误反馈让大模型从自然语言 CVE 描述自动生成 PDDL 编码攻击路径,在 21 个 CVE、5 个模型、12 种配置下评估,最佳模型 GPT-5.5 取得 86.9% 语法正确率、78.6% 可解性、53.8% 嵌入相似度与 93.1% 专家语义正确率,错误反馈带来最一致提升,GPT-5.5 质量成本权衡最佳。

Source-provided article image: CVE2AP: Automated Generation of PDDL-Encoded Attack Paths via Large Language Models
Fig. 2 ·

Fig. 2 : The overview of the CVE2AP.

arXiv

深度剖析

提出 CVE2AP,把自然语言 CVE 描述自动转换为 PDDL 编码攻击路径,同时面向语法正确、规划可解与网络安全语义保真三类要求。 既有 PDDL 攻击路径建模多依赖专家手工构建,而通用 PDDL 域生成的 LLM 方法未针对攻击路径特有的威胁模型合规、利用机制保真与攻击阶段完整性。 方法为模型无关设计,可接入任意支持对话或补全接口的 LLM;在 21 个 CVE 上以 S3Eval 三层流水线评估,覆盖语法、可解性与语义。

引入由领域无关规划器驱动的错误反馈机制,用规划器报告的语法与可解性错误在同一对话内迭代修正,最多三次重试。 相较仅靠提示约束,该机制把外部规划器的可验证错误信号纳入生成循环,且无需人工介入。 错误反馈在语法上最多提升 49 个百分点、可解性最多 41 个百分点、LLM-as-expert 语义最多 12 个百分点,但嵌入相似度略有下降;规划器检查每域在毫秒级完成。

系统刻画不同模型与配置的质量—成本画像:GPT-5.5 质量最高且质量成本权衡最佳,本地 Qwen3 系列随规模提升而改善。 此前工作未在攻击路径生成任务上同时报告多模型、多配置的语法、可解性、语义与 token、时间成本。 GPT-5.5 达 86.9% 语法、78.6% 可解性、53.8% 嵌入相似度、93.1% 专家语义;Qwen3-32B 语法 39.7%、约三分之一可解、语义超 20%;GPT-5.5 中位生成时间约 85 秒,Deepseek-V4-Pro 约 65 秒但每样本约 53,000 token。

配置分析显示错误反馈是最一致有效的策略,而少样本示例与结构化输出模板的收益因模型而异且伴随成本上升。 把配置维度作为独立变量量化其对质量与成本的影响,而非仅报告单一最佳设置。 少样本示例使时间与 token 单调上升,Deepseek-V4-Pro 在 1-shot 与 2-shot 下 token 超过 0-shot 两倍;输出模板仅提升可解性约 1–5 个百分点,对较弱本地模型反而增加提示复杂度。

启示与展望

该结果面向从单条 CVE 描述生成单漏洞攻击路径的场景,适用于需要规划器可执行且语义可信表示的网络安全分析流程;方法模型无关,可在在线商用模型或本地自托管模型上实例化,并支持 0/1/2-shot、是否启用错误反馈与是否使用输出模板的组合。对希望降低专家手工建模负担、把威胁情报快速转为形式化表示的团队,这一流程提供了可复现的起点;错误反馈机制尤其适合已有领域无关规划器可用的部署环境。

语义正确性目前由嵌入相似度与 LLM-as-expert 评判给出,其中嵌入相似度在错误反馈下略有下降,且现有语义评估只给质量判断而非可定位的修正反馈,因此语义反馈仍是开放方向。评估基于 21 个 CVE 与特定模型集合,跨漏洞类型与更大规模的泛化程度尚待观察;GPT-5.5 受内容安全过滤影响,少量生成被非确定性拦截并需重试。多漏洞与链式利用路径不在当前范围内。

来源