跳到主要内容
返回时间线
arXiv来源发表:

LLMLeak 利用 LLM 网页抓取工具建立隐蔽信道,在十一个开放参数模型上取得 79.7% 的攻击成功率

核心概要

本文提出 LLMLeak,一种新型攻击向量:本地运行但无法直接联网的恶意软件把秘密编码进 URL,并把它伪装成良性任务(如迁移软件库)所需的信息来源,诱导 LLM 通过其网页抓取工具访问该 URL,从而经攻击者控制的 DNS 或 Web 服务器把秘密外传;在十一个开放参数模型上的评测显示攻击成功率为 79.7%,并在真实聊天机器人上做了案例研究。

Source-provided article image: The Innocent Courier: Covert Exfiltration Through Legitimate LLM Web Fetching
Figure 1 ·

Figure 1 : Overview of LLMLeak ’s steps.

arXiv

深度剖析

论文展示了一条此前未被描述的隐蔽信道:本地恶意软件借助 LLM 的网页抓取工具把机密数据外传给第三方。 已有工作主要关注提示注入以及向聊天机器人运营方泄露敏感数据,并提出了输入结构化、部署本地 LLM 等对策;本文把关注点转向“经 LLM 向第三方泄露”,并指出该信道不依赖生成代码直接发送数据。 以 LLMLeak 这一具体攻击实现加以演示,并在十一个开放参数模型上评测,报告 79.7% 的攻击成功率,另附真实聊天机器人的案例研究。

该攻击之所以可行,是因为它只依赖 LLM 获取网站信息的工具,而这类工具通常被视为正常功能而非外发通道。 论文指出,指示 LLM 通过生成代码直接发送数据的输入容易被检测,网络库通常也受限制;LLMLeak 绕开这两点,把秘密嵌入 URL,并把目标网站包装成良性任务(例如迁移软件库)所需的信息来源。 摘要以机制描述与评测结果共同支撑:客户端恶意组件嵌入秘密,LLM 访问 URL 后,攻击者通过其控制的 DNS 或 Web 服务器收到编码后的秘密。

该风险在真实聊天机器人场景中具有相关性,而不只是实验室设定。 在开放参数模型评测之外,论文补充了针对真实世界聊天机器人的案例研究,用以说明 LLMLeak 的现实适用性。 案例研究作为摘要中报告的补充证据;摘要未给出案例研究的具体数量、配置或结果细节。

启示与展望

这项工作面向使用 LLM 或 LLM 智能体、且模型具备网页抓取工具的场景,尤其是本地存在恶意软件组件、该组件自身无法直接联网的客户端环境。它给出的可直接使用的结果是:一条把秘密编码进 URL、借良性任务名义诱导模型抓取的攻击路径,以及在十一个开放参数模型上的 79.7% 攻击成功率与真实聊天机器人的案例研究。对防御方而言,这提示需要把“模型访问外部 URL”视为潜在外发通道来审视;对研究者而言,它提供了一个可复现的攻击设定,用于检验输入结构化、本地部署等既有对策是否覆盖这一路径。

摘要未说明十一个开放参数模型的具体清单、评测任务与判定标准,也未给出案例研究中聊天机器人的数量与配置,因此 79.7% 这一数字所对应的条件范围仍需在原文中确认。此外,摘要未报告针对该信道的防御评估,既有对策(输入结构化、本地 LLM 部署)能否阻断 LLMLeak 属于开放问题。由于本次可获取的是摘要级文本,缺少图表与实验细节,上述判断以摘要所述为限。

来源