跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

在 ε≤4/255 的扰动预算内,针对视觉语言模型的定向语义替换可让模型命名目标、确认其存在并否认源内容,图像完整替换率达 38%、视频达 35.9%

该工作在白盒威胁模型下,将源图像各流与目标图像对应流在受害视觉语言模型合并后的 token 空间中对齐,并在严格成功标准(同时命名目标、确认其存在、否认源)下评估,发现图像在 ε=2/255 时出现目标语义、ε=4/255 时完整替换达 38%,视频在 ε=1/255 时完整替换达 35.9%,同时观察到语义融合现象。