分而治之:一种混合策略攻破多模态大语言模型
核心概要
该工作提出 JMLLM——一个整合交替翻译、词加密、特征坍缩与有害注入四种隐蔽策略、覆盖文本、视觉与语音三种模态的越狱框架,并发布包含 1,250 条文本与语音对抗提示和 150 张有害图像的 TriJail 数据集,在 16 个主流大模型与 AdvBench、TriJail 两个数据集上以单次查询 24.65 秒、多轮 6 次查询取得领先的攻击成功率,同时提出 Harmful Separator 防御策略以降低攻击成功率。
Fig. 1: A typical application scenario illustrating the potential harms of LLM jailbreaks.
arXiv深度剖析
提出首个同时覆盖文本、视觉、语音三模态的混合策略越狱框架 JMLLM,用交替翻译、词加密、特征坍缩、有害注入四种毒性隐蔽技术绕过各模态防御。 既有方法多集中于单一模态或文本加视觉的双模态,本文把三模态整合进同一框架,并区分单查询与多查询两种攻击模式。 论文给出四种策略的公式化描述与伪代码(算法 1、算法 2),并在 TriJail 与 AdvBench 上做消融,显示移除任一模块后 ASR 下降。
构建 TriJail 数据集,包含 1,250 条文本提示、1,250 条语音提示与 150 张有害图像,覆盖仇恨言论与歧视、错误信息、暴力威胁与霸凌、色情剥削内容、隐私侵犯、自我伤害六类场景。 论文称既有越狱数据集多为单模态或双模态,且语义场景集中在炸弹、毒品、暴力等有限领域,TriJail 补充了语音模态与更广的场景划分。 表 I 给出各场景的文本、图像、语音数量及词数、token 数统计;构建流程为从论坛人工提取并改写、人工设计提示,再经 TTS-1 生成语音、DALL-E-3 生成图像。
在 AdvBench 上,JMLLM 单查询模式在 GPT-3.5-turbo、GPT-4、Claude-1、Claude-2、Llama2-7B 上的 GPT-ASR 与 KW-ASR 均高于 GCG、AutoDAN、PAIR、ReNeLLM 四个基线,且单次攻击耗时 24.65 秒,低于 ReNeLLM 的 132.03 秒。 相对强基线 ReNeLLM,论文报告执行效率提升约 5.36 倍,同时 ASR 更高;多轮模式仅用 6 次查询即进一步提升 ASR。 表 V 列出各基线的 GPT-ASR、KW-ASR、单次攻击耗时与查询次数;论文另用表 XIII 在 AdvBench 的 7 个场景上与 ReNeLLM 逐项对比。
提出 Harmful Separator 防御策略,将越狱提示拆分为无害指令与可能有害的示例两部分并独立检测示例,在 GPT-3.5-turbo、Llama-3.1-405B、GPT-4o 上分别将 JMLLM 的 ASR 降低 0.622、0.385、0.547。 论文报告仅要求模型生成合法响应的 Useful and Safe 方法几乎不降低攻击成功率,而 Harmful Separator 显著降低但未完全消除风险。 表 XIV 给出三种模型上 JMLLM 基线 ASR 与两种防御方法的 ASR 变化量;防御思路受结构化查询前端方法启发。
启示与展望
该结果面向多模态大模型安全评测与红队研究场景,适用于文本、视觉、语音三模态输入的越狱检测;TriJail 覆盖六类禁止场景,可用于比较不同模型与不同防御方法的攻击成功率。论文指出当前多模态模型已扩展到视频、触觉等模态,越狱研究需向更复杂多模态环境与具身智能体延伸,因此本文结论主要适用于其测试的模态与模型范围。
论文报告 TOX-ASR 明显低于其他三种指标,KW-ASR 因仅检查关键词可能偏高,因此不同评估口径下的成功率差异值得留意;语音模态实验每个场景随机抽取 20 条样本,视觉与语音消融的样本规模与统计波动在正文中未展开;论文也指出闭源模型存在黑盒问题、模型迭代可能使攻击失效,以及越狱数据收集的合规与伦理成本,这些是后续工作需持续观察的方向。
