Trident 用可训练 7B 规划器把 DRL 网络防御性能平均拉低 522%,并自主涌现诱饵规避与自适应状态优先级行为
核心概要
该工作提出 Trident——一个由动态基准(含 CybORG CAGE 4 与 CyberWheel 的隔离沙箱服务器)、超过 13,000 条高保真红蓝交互轨迹数据集,以及“Code-as-Policy”RLVR 智能体架构(Trident Agentic)组成的智能体化 LLM 红队框架;其中 Trident Agentic 通过 Log Summarizer—Planner—Coder 三方设计把红方训练重构为上下文赌博机,由可训练 Planner 从压缩执行日志生成完整攻击策略、由冻结 Coder 翻译为可执行 Python 策略并部署对抗实时 DRL 防御方;实证评估显示,仅用一个可训练 7B 规划器,Trident 相比静态红方基线使蓝方
Figure 1: Overview of the Trident Agentic framework. A Log Summarizer observes and summarizes sanitized logs, enabling a trainable Planner ( π θ \pi_{\theta} ) to formulate abstract tactics. A frozen Coder translates the tactic into an executable Python policy deployed against a live DRL defender. Execution logs provide a verifiable reward signal to update π θ \pi_{\theta} via GRPO.
arXiv深度剖析
Trident 把红方训练重构为上下文赌博机,采用 Log Summarizer—Planner—Coder 三方架构:可训练 Planner 从压缩执行日志生成完整攻击策略,冻结 Coder 将其翻译为可执行 Python 策略并部署对抗实时 DRL 防御方。 此前基于 DRL 的自主网络防御几乎只针对静态、启发式红方进行评估,自适应威胁下的鲁棒性研究不足;RLVR 虽提升了 LLM 推理能力,但因缺乏合适基准环境与交互数据集而难以进入网络安全领域。 该架构由论文明确描述为“Code-as-Policy”RLVR 智能体架构,并说明其三方组件分工;评估中仅使用单个可训练 7B 规划器。
Trident 配套提供动态基准与数据集:动态基准包含跨 CybORG CAGE 4 与 CyberWheel 的隔离沙箱服务器,数据集包含超过 13,000 条高保真红蓝交互轨迹,用于 RLVR。 论文将 RLVR 难以进入网络安全归因于缺少合适的基准环境与交互数据集,这两项资源正是针对该缺口提出的。 数据集规模“超过 13,000 条高保真红蓝交互轨迹”与基准覆盖的两个环境名称均在原文中给出。
实证评估显示现有防御存在根本性脆弱:相比静态红方基线,Trident 使蓝方防御性能平均下降 522%。 该结果把评估对象从静态启发式红方转向自适应 LLM 红方,从而暴露出静态评估未能显现的防御脆弱性。 原文给出“平均 522%”的量化对比,并强调该效果来自单个可训练 7B 规划器。
Trident 自主发现诱饵规避与自适应状态优先级等涌现行为,而静态启发式完全无法揭示这些行为。 这些行为并非由人工规则写入,而是由可训练 Planner 在对抗实时 DRL 防御方过程中自主产生,属于静态红方基线无法覆盖的行为空间。 原文以“autonomously discovering emergent behaviors”表述,并点名 decoy avoidance 与 adaptive state prioritization 两类行为。
启示与展望
该工作面向以 DRL 为防御核心的自主网络防御系统,评估设定为 CybORG CAGE 4 与 CyberWheel 上的隔离沙箱服务器,红方为可训练 Planner 加冻结 Coder 的智能体化 LLM,蓝方为实时 DRL 防御方。它使自适应红队评估与 RLVR 训练成为可操作路径:研究者可借助动态基准与超过 13,000 条红蓝交互轨迹训练和比较红方策略,防御方开发者可在自适应对手而非静态启发式下重新检验防御鲁棒性。
本次读取范围为摘要,未包含图表、统计检验与实验配置细节,因此 522% 的具体度量口径、基线集合、环境间差异以及涌现行为的判定方式仍是开放问题。此外,该结果来自 CybORG CAGE 4 与 CyberWheel 两个沙箱环境与单个 7B 规划器设定,向其他防御架构、其他网络环境与其他规模规划器的推广程度尚待观察;RLVR 在网络安全中的长期稳定性与红蓝共同演化下的表现也值得持续跟踪。
