跳到主要内容
返回时间线
arXiv来源发表:

Reflex-Guard 用本地稠密语义嵌入把提示安全过滤压到 37.6 毫秒,并在 30,568 条样本上取得 95.9% 有害提示召回

核心概要

该工作提出 Reflex-Guard,一个本地运行的轻量级 LLM 提示安全护栏,结合越狱感知预处理、紧凑句向量嵌入与七个快速二分类器,在来自五个互补来源、共 30,568 条样本的平衡数据集上实现 95.9% 有害提示召回与 37.6 毫秒端到端延迟,快于 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒),默认阈值下可检出 100% 的 GCG 后缀攻击与 Base64 编码提示,而 DrAttack 结构化提示需将阈值降至 0.03 才能获得最佳检测效果。

Source-provided article image: Reflex-Guard: A Low-Latency Guardrail for LLM Prompt Safety Using Dense Semantic Embeddings
Fig. 1 ·

Fig. 1: Overall Reflex-Guard pipeline architecture.

arXiv

深度剖析

Reflex-Guard 在 30,568 条样本的平衡数据集上达到 95.9% 有害提示召回,端到端延迟为 37.6 毫秒。 既有护栏方案(如 LLM-as-a-judge 与云端安全 API)通常为每个请求增加约 250-900 毫秒延迟,而实时应用常需在 100 毫秒内响应;该工作把延迟压到远低于这一门槛。 基于五个互补来源构建的策略性平衡数据集上的系统评测,并与 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒)直接对比。

默认阈值下可检出 100% 的 GCG 后缀攻击与 Base64 编码提示。 说明越狱感知预处理与紧凑句向量嵌入对这两类攻击形态具有稳定的覆盖能力。 在评测数据集中对这两类攻击的检出率报告为 100%。

DrAttack 结构化提示需要把阈值降到 0.03 才能获得最佳检测,因为它们产生了不同的概率分布。 揭示不同攻击类型在嵌入概率空间中占据不同区域,单一默认阈值未必适配所有攻击形态。 通过阈值调整实验观察到 DrAttack 的概率分布与其它攻击类型不同。

Reflex-Guard 的 Reflex Efficiency Score(RES)最高达 16.79,高于 Llama Guard 2 的 11.90 与 SafeDecoding 的 9.80。 该综合效率指标把准确性与延迟放在一起比较,显示本地轻量方案在效率维度上明显领先。 在同一评测设置下与两个基线给出的 RES 数值对比。

启示与展望

该结果面向需要在 100 毫秒内响应的实时 LLM 应用,以及不愿把用户提示路由到外部审核端点的场景;本地运行、紧凑嵌入与七个二分类器的组合使这一护栏可在本地部署。对 GCG 后缀攻击与 Base64 编码提示,默认阈值即可覆盖;对 DrAttack 结构化提示,则需把阈值降到 0.03。文中给出的部署建议正是围绕不同攻击类型在嵌入概率空间中的分布差异展开。

不同攻击类型在嵌入概率空间中占据不同区域,意味着阈值选择与攻击形态相关,DrAttack 需要 0.03 这一更低阈值即为实例;这一现象在更广泛、持续演化的攻击面上的表现仍是开放问题。此外,当前文本为摘要级信息,未包含图表与逐类别的详细结果,因此各类攻击的具体分布与误报情况无法从现有材料进一步确认。

来源