SkillDRE 用预执行扫描与运行时反馈的双阶段闭环进化恶意技能,在 SkillsBench 四个受害模型上平均攻击成功率 45.28%
核心概要
SkillDRE 是一个全自动框架,给定良性任务及其关联技能后,自主构造并验证任务条件下的恶意目标与可验证判定规则,并在保持二者固定的前提下,通过扫描器引导的进化与运行时防御反馈引导的细化交替迭代,使完整恶意技能包在预执行扫描与运行时防御两个阶段之间形成闭环,在 SkillsBench 上对四个受害模型取得 45.28% 的平均攻击成功率,比最强基线高出 40.3%,且最终提交的技能未触发任何 SkillScan 发现并大体保留良性任务性能。
深度剖析
论文提出把预执行扫描与运行时防御两个阶段的反馈同时当作学习信号,用双阶段闭环进化完整恶意技能包,而不是只针对单一防御阶段做优化。 此前对技能的攻击性演化通常只考虑某一阶段的检测或执行结果;SkillDRE 让每次运行时引导的修改都回到预执行阶段重新扫描与再优化,再重新执行,从而把两个阶段的反馈串成跨阶段闭环。 摘要说明该框架为全自动,并在 SkillsBench 上对四个受害模型进行评估,报告平均攻击成功率 45.28%,比最强基线高 40.3%。
SkillDRE 在给定良性任务与关联技能后,能自主构造并验证任务条件下的恶意目标以及可验证的判定规则,并在后续进化中保持这两者固定。 把恶意目标与判定规则的构造和验证自动化,使技能实现的进化有稳定的评价锚点,同时要求保留合法任务能力。 摘要明确描述该自动化构造与验证流程,以及固定目标与判定规则、保留良性任务能力的设定;具体构造细节与验证方式在摘要中未展开。
最终提交的技能在取得攻击效果的同时未触发 SkillScan 发现,并大体保留良性任务性能。 说明攻击能力与预执行扫描下的可检测性可以同时被优化,而不必以牺牲良性功能为代价。 摘要报告最终提交技能收到零条 SkillScan 发现,并大体保留良性任务性能;具体保留程度与评测口径在摘要中未给出。
论文指出单独评估任一防御阶段都可能漏掉由此产生的攻击能力。 这一观察把评估口径本身作为结论的一部分,提示只看预执行扫描或只看运行时防御都不足以刻画技能演化后的实际风险。 摘要以该表述总结实验结果的含义,并给出 45.28% 平均攻击成功率与相对最强基线 40.3% 的提升作为支撑。
启示与展望
该工作面向智能体技能包这一形态,适用于同时部署预执行扫描与运行时防御的技能生态;其结论建立在 SkillsBench 与四个受害模型的评估之上,并以平均攻击成功率 45.28%、相对最强基线提升 40.3%、最终技能零 SkillScan 发现、大体保留良性任务性能作为主要证据。对防御方而言,这意味着需要把两个阶段的反馈放在同一评估回路中考察,而不是分别打分;对红队研究而言,它给出了一条可复用的自动化流程,用于在保持良性功能的前提下检验技能演化后的实际攻击能力。
摘要未给出逐受害模型的结果分布、SkillsBench 的任务与样本规模、基线集合的构成,也未说明良性任务性能保留程度的度量方式;零 SkillScan 发现对应的是哪一版本扫描器与何种配置同样未在摘要中交代。此外,恶意目标与判定规则的自动构造在何种任务条件下仍然可靠,以及该闭环在防御方持续更新时的稳定性,都是摘要层面尚待展开的问题。
