在 ε≤4/255 的扰动预算内,针对视觉语言模型的定向语义替换可让模型命名目标、确认其存在并否认源内容,图像完整替换率达 38%、视频达 35.9%
相关研究与后续进展核心概要
该工作在白盒威胁模型下,将源图像各流与目标图像对应流在受害视觉语言模型合并后的 token 空间中对齐,并在严格成功标准(同时命名目标、确认其存在、否认源)下评估,发现图像在 ε=2/255 时出现目标语义、ε=4/255 时完整替换达 38%,视频在 ε=1/255 时完整替换达 35.9%,同时观察到语义融合现象。
Figure 1: Qualitative image example on Qwen3-VL (dog → \rightarrow cat, ϵ \epsilon = 4/255). Adversarial images are omitted: at ϵ \epsilon = 4/255, the maximum per-pixel change is 1.6% of the full intensity range. All questions are posed independently to the VLM, each on the same adversarial image.
arXiv深度剖析
提出针对视觉语言模型的定向语义替换攻击,在合并后的 token 空间中对齐源图像与目标图像的对应流,使模型将源内容替换为目标语义。 既有表示对齐攻击在 ε≤4/255 范围内成功率有限,因而被认为该范围内模型较为鲁棒;该工作表明在同一扰动范围内定向语义替换可以成功。 在白盒威胁模型下评估,采用严格成功标准,要求模型同时命名目标、确认其存在并否认源;图像在 ε=2/255 出现目标语义,ε=4/255 完整替换达 38%,视频在 ε=1/255 完整替换达 35.9%。
在图像与视频两种模态上验证了定向语义替换的有效性,并给出不同扰动预算下的完整替换比例。 此前表示对齐攻击在 ε≤4/255 下成功有限,该工作在图像与视频上均报告了完整替换结果,扩展了该扰动范围内可实现的语义控制程度。 图像完整替换在 ε=4/255 达 38%,视频完整替换在 ε=1/255 达 35.9%,均以严格成功标准衡量。
观察到语义融合现象,即大语言模型将相互矛盾的视觉信号合理化为连贯叙述。 该现象揭示了模型在面对冲突视觉输入时的行为方式,补充了定向语义替换之外对模型内部整合过程的观察。 基于实验观察报告,未在摘要中给出量化比例或统计检验。
启示与展望
该工作面向需要评估视觉语言模型可信度的研究者与工程实践者,适用于白盒威胁模型下、扰动预算 ε≤4/255 的图像与视频场景。其严格成功标准要求模型同时命名目标、确认其存在并否认源,因此所报告的完整替换比例对应的是这一强条件下的语义控制程度。语义融合现象的观察为理解模型如何整合冲突视觉信号提供了切入点,可用于后续对模型内部整合机制与鲁棒性评估方法的研究。
摘要未说明所用视觉语言模型的具体身份与数量、图像与视频数据集的构成与规模、完整替换比例的统计不确定性,以及语义融合现象的量化程度。白盒威胁模型下的结果向黑盒或实际部署场景的迁移程度仍需进一步考察。语义融合的触发条件与稳定性也值得在后续工作中继续观察。
