arXiv 该工作提出 PI3D,一种针对 3D 环境中多模态大语言模型的提示注入攻击:攻击者不修改数字图像,而是在物理环境中放置带文字的 3D 物体,并求解该物体的有效位姿(位置与朝向),使其既能诱导模型执行注入任务、又保持物理上合理的摆放;实验表明 PI3D 在多种相机轨迹下对多个 MLLM 均有效,且所评估的一系列防御不足以可靠抵御该攻击。
该工作提出 PI3D,一种针对 3D 环境中多模态大语言模型的提示注入攻击:攻击者不修改数字图像,而是在物理环境中放置带文字的 3D 物体,并求解该物体的有效位姿(位置与朝向),使其既能诱导模型执行注入任务、又保持物理上合理的摆放;实验表明 PI3D 在多种相机轨迹下对多个 MLLM 均有效,且所评估的一系列防御不足以可靠抵御该攻击。
该工作提出 PI3D,一种针对 3D 环境中多模态大语言模型的提示注入攻击:攻击者不修改数字图像,而是在物理环境中放置带文字的 3D 物体,并求解该物体的有效位姿(位置与朝向),使其既能诱导模型执行注入任务、又保持物理上合理的摆放;实验表明 PI3D 在多种相机轨迹下对多个 MLLM 均有效,且所评估的一系列防御不足以可靠抵御该攻击。
该工作提出 PI3D,一种针对 3D 环境中多模态大语言模型的提示注入攻击:攻击者不修改数字图像,而是在物理环境中放置带文字的 3D 物体,并求解该物体的有效位姿(位置与朝向),使其既能诱导模型执行注入任务、又保持物理上合理的摆放;实验表明 PI3D 在多种相机轨迹下对多个 MLLM 均有效,且所评估的一系列防御不足以可靠抵御该攻击。