Reflex-Guard 以 37.6 毫秒本地护栏实现 95.9% 有害提示召回,快于 Llama Guard 2 与 SafeDecoding
核心概要
该工作提出 Reflex-Guard,一个本地运行的轻量级 LLM 提示安全护栏,结合越狱感知预处理、紧凑句向量嵌入与七个快速二分类器,在来自五个互补来源、共 30,568 条样本的平衡数据集上实现 95.9% 有害提示召回与 37.6 毫秒端到端延迟,快于 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒),默认阈值下可检出 100% 的 GCG 后缀攻击与 Base64 编码提示,而 DrAttack 结构化提示需将阈值降至 0.03 才能达到最佳检测。
Fig. 1: Overall Reflex-Guard pipeline architecture.
arXiv深度剖析
Reflex-Guard 在 30,568 条样本的平衡数据集上达到 95.9% 有害提示召回,端到端延迟为 37.6 毫秒。 既有护栏方法(如 LLM-as-a-judge 与云端安全 API)通常为每个请求增加约 250-900 毫秒延迟,而实时应用通常需要低于 100 毫秒响应;该工作把延迟压到 37.6 毫秒并保持高召回。 基于五个互补来源构建的策略性平衡数据集,共 30,568 条样本,报告了召回率与端到端延迟两项指标。
Reflex-Guard 比 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒)更快,并在 Reflex Efficiency Score(RES)上取得最高 16.79,高于 Llama Guard 2 的 11.90 与 SafeDecoding 的 9.80。 该工作引入 RES 作为同时衡量效率与效果的指标,并给出与两个基线的直接对比数值。 系统化评估中报告了与两个具名基线的延迟与 RES 对比。
默认阈值下 Reflex-Guard 可检出 100% 的 GCG 后缀攻击与 Base64 编码提示,但 DrAttack 结构化提示需将阈值降至 0.03 才能达到最佳检测。 该工作显示不同攻击类型在嵌入概率空间中占据不同区域,并据此给出按攻击类型调整阈值的部署建议。 针对 GCG 后缀、Base64 编码与 DrAttack 结构化提示分别报告了默认阈值与调整阈值下的检测表现。
Reflex-Guard 采用本地运行架构,由越狱感知预处理、紧凑句向量嵌入与七个快速二分类器组成。 相比将用户提示路由至外部审核端点,本地运行避免了由此带来的数据隐私顾虑。 组件构成在文中明确描述,并作为实现低延迟与高准确率过滤的基础。
启示与展望
该结果面向需要在 100 毫秒内响应、且不希望将用户提示送往外部审核端点的实时 LLM 应用部署场景;本地运行的轻量级设计使这类系统可在自有环境中完成提示安全过滤。文中给出的按攻击类型调整阈值的建议(例如 DrAttack 结构化提示使用 0.03 阈值)可直接用于部署配置。
不同攻击类型在嵌入概率空间中占据不同区域,意味着单一默认阈值未必对所有攻击形态都最优,DrAttack 需要 0.03 阈值即为一例;读者可关注这一阈值敏感性在更多攻击类型与真实流量分布下的表现。此外,当前可见文本为摘要与浏览上下文,未包含图表与逐类别的完整结果,因此各攻击类型的具体数值分布与误报情况仍是待查的开放问题。
