跳到主要内容
返回时间线
arXiv来源发表:

随机化密钥选择让盲攻击者伪造水印成功率从87%降至1%,且不额外损害模型效用

相关研究与后续进展

核心概要

该工作提出一种与底层水印方法无关的防御方案:对每次查询随机选择水印密钥,并且仅当内容被恰好一个密钥检测到水印时才判定为真实,从而在密钥对称且检测器结果独立的条件下为盲攻击者给出与样本数量无关的伪造成功率上界,且不进一步损害模型效用;在评估的自适应盲攻击者下,r=4 个密钥时有害文本伪造成功率从单密钥的高达87%降至低至1%,初步图像研究(Tree-Ring)显示从100%降至2%。

Source-provided article image: Mitigating Watermark Forgery in Generative Models via Randomized Key Selection
Fig. 1 ·

Fig. 1 : An overview of forgery attacks and our proposed randomization strategy for watermarking key selection to improve forgery-resistance.

arXiv

深度剖析

提出一种随机化密钥选择的防御机制:对每次查询随机化水印密钥的选择,并且只有当水印被恰好一个密钥检测到时才接受内容为真实。 与通过在同一内容中嵌入多个密钥的多个水印来抵抗伪造的既有防御不同,该方案不进一步损害模型效用,并针对盲攻击者给出与样本数量无关的伪造成功率上界。 该上界以密钥对称、检测器结果独立为条件;文本为主,另含使用 Tree-Ring 的图像水印初步研究。

该防御将底层水印方法视为黑盒,因此可应用于任何现有水印方法以提升其抗伪造能力,且与依赖计算硬度假设、需要从头设计新方案的密码学水印不同。 既有密码学水印需要新的方案设计并依赖计算硬度假设,而本方法作为可叠加的通用层,无需重新设计水印方案。 摘要明确说明方法可应用于任何现有水印方法,并称其与模态无关;图像部分以 Tree-Ring 的初步研究作为跨模态适用性的展示。

在评估的自适应盲攻击者下,r=4 个密钥时有害文本伪造成功率从单密钥的高达87%降至低至1%,计算开销可忽略;初步图像研究显示从100%降至2%。 这些经验观察与前述条件性保证分开陈述,量化了多密钥随机化在文本与图像两类模态上的伪造抑制幅度。 为作者在摘要中报告的经验观察,针对其所评估的自适应盲攻击者;图像结果为初步研究。

启示与展望

该方案面向需要验证内容是否由自家模型生成的生成式AI提供方,适用于可对每次查询随机化密钥选择、并能以“恰好一个密钥检测到”作为接受判据的检测流程;由于把底层水印方法当作黑盒,它被定位为可叠加在现有水印方法之上的通用层,而非替代方案。摘要称其与模态无关,并以 Tree-Ring 的图像水印初步研究作为跨模态适用性的展示,因此下一步可检验其在更多水印方法与更多模态上的表现。理论保证的适用范围限于盲攻击者,并以密钥对称、检测器结果独立为条件。

条件性上界依赖密钥对称与检测器结果独立这两项前提,读者需要了解这些前提在具体水印方法下如何满足;经验数字针对作者所评估的自适应盲攻击者,换用其他攻击者时结果可能不同;图像结果被作者表述为初步研究,其覆盖范围有限;此外,当前可见文本为摘要与提交历史,未包含实验细节、攻击者设定与效用度量,因此具体评估条件仍需查阅原文。

来源