PI3D 通过在 3D 环境中摆放带文字物体,让多个多模态大模型执行注入任务,并显示现有防御难以可靠拦截
相关研究与后续进展核心概要
该工作提出 PI3D,一种针对 3D 环境中多模态大语言模型的提示注入攻击:攻击者不修改数字图像,而是在物理环境中放置带文字的 3D 物体,并求解该物体的有效位姿(位置与朝向),使其既能诱导模型执行注入任务、又保持物理上合理的摆放;实验表明 PI3D 在多种相机轨迹下对多个 MLLM 均有效,且所评估的一系列防御不足以可靠抵御该攻击。
Figure 1: Prompt injection in 3D environments: a whiteboard with injected text causes the MLLM to mistakenly describe the outdoor suburban neighborhood as a “library.”
arXiv深度剖析
提出 PI3D,把提示注入从文本域和数字编辑的 2D 图像扩展到 3D 物理环境,攻击载体是环境中带文字的实体物体而非图像像素修改。 此前工作研究文本域提示注入与经数字编辑的 2D 图像注入,而对这类攻击在 3D 环境中如何运作关注有限;PI3D 填补这一空白,将攻击面定位到相机拍摄的真实世界视图。 论文以问题设定与攻击构造的形式给出 PI3D,并说明其通过带文字物体摆放实现,而非数字图像编辑。
将攻击形式化为一个位姿求解问题:为带注入文字的 3D 物体寻找有效的位置与朝向,使模型执行注入任务,同时保证物体摆放保持物理上合理。 把攻击效果与物理合理性同时纳入优化目标,使注入不再依赖任意可编辑的图像内容,而受制于真实场景中物体可放置的方式。 摘要明确说明作者“formulate and solve”该位姿识别问题,并同时给出诱导任务与物理合理性两项约束。
实验显示 PI3D 在多种相机轨迹下对多个 MLLM 均为有效攻击。 有效性不局限于单一模型或单一视角,说明该攻击面对不同模型与不同观察路径时仍可成立。 摘要报告“PI3D is an effective attack against multiple MLLMs under diverse camera trajectories”,属于多模型、多轨迹条件下的实验结论。
对一系列防御进行评估后,发现这些防御不足以可靠地防御 PI3D。 把评估从攻击成功率延伸到防御侧,指出当前防御手段在该威胁模型下难以提供可靠保护。 摘要称“we further evaluate a range of defenses and show that they are not sufficient to reliably defend against PI3D”,为防御评估层面的结论。
启示与展望
该工作面向在 3D 环境中依据相机捕获视图进行推理与行动的多模态大语言模型,适用场景包括机器人与情境对话代理等。其攻击设定假定攻击者能够在物理环境中放置带文字的 3D 物体,并以位姿(位置与朝向)为可控变量,同时要求摆放保持物理上合理。结论的适用范围是多模型、多相机轨迹条件下的攻击有效性,以及所评估防御集合的不足;对未纳入评估的模型、环境类型或防御机制,本文不给出结论。
可见文本为摘要层面,未给出攻击成功率、位姿搜索的具体算法、实验所用模型清单、相机轨迹数量、防御种类与评估指标,因此无法判断效果量级与不同条件下的差异。物理合理性的判定标准、攻击者对环境的先验知识要求、以及防御在更强设定下是否仍不足,均属需要阅读原文才能确认的开放问题。此外,摘要未说明该攻击在动态环境或人机共存场景中的表现。
