TP-CRIV 提出第三方挑战—应答身份验证框架,在十个 ImageNet 预训练 TorchVision 模型上实现同模型与跨模型的可分离验证
核心概要
该工作提出面向 AI 模型的第三方挑战—应答身份验证框架 TP-CRIV,在验证者既无白盒也无 API 访问、只能通过可疑部署服务的普通黑盒推理接口交互、且不需要服务提供方协议配合的条件下,通过全新未披露的挑战与网络隔离获取经验证据,判断声称方是否本地拥有与所部署模型相符的预声明身份;作者以基于概率控制的见证生成方法为 CNN 图像分类器实例化该框架,并在十个 ImageNet 预训练 TorchVision 模型上展示了清晰的同模型/跨模型分离以及使用独立校准阈值的有限挑战次数验证。
Fig. 1: Comparison of model-to-model verification approaches from the perspective of the evidence available to an independent third party and the resulting inference about the relationship between a claimant’s model and a suspicious deployed model.
arXiv深度剖析
提出 TP-CRIV 这一第三方挑战—应答身份验证框架,用于判断声称方是否当前拥有并能够使用与所声称模型身份相关的模型依赖信息。 既有方法如水印、指纹和模型相似度分析主要依赖预定义证据或直接行为比较,而 TP-CRIV 明确把“声称方当前是否持有并可使用模型依赖信息”作为验证目标。 论文以框架形式给出该设定与目标,并在摘要中说明其针对的第三方验证约束条件。
明确了验证的约束条件:验证者既无白盒也无 API 访问,只能通过可疑部署服务的普通黑盒推理接口交互,且不需要服务提供方提供协议特定配合。 这一设定把验证能力从需要内部访问或服务方协作的场景,扩展到仅依赖普通黑盒推理接口的第三方场景。 摘要中明确列出这三项约束,并说明框架在这些约束下使验证者获得经验证据。
验证在全新、此前未披露的要求与网络隔离下进行,使所展示的能力在挑战披露后不能依赖在线外部协助。 通过新鲜挑战与网络隔离,降低所展示能力来自在线外部协助而非本地模型持有的可能。 摘要中说明验证在“fresh, previously undisclosed requirements and network isolation”下进行。
以基于概率控制的见证生成方法为 CNN 图像分类器实例化 TP-CRIV,并在十个 ImageNet 预训练 TorchVision 模型上展示清晰的同模型/跨模型分离与使用独立校准阈值的有限挑战次数验证。 把框架落到具体模型类别与实验设置,并给出同模型与跨模型可分离的实验观察。 实验覆盖十个 ImageNet 预训练 TorchVision 模型,结果被描述为清晰的同模型/跨模型分离,并使用独立校准的阈值进行有限挑战次数验证。
启示与展望
该框架面向第三方验证场景:验证者既无白盒也无 API 访问,只能通过可疑部署服务的普通黑盒推理接口交互,且不需要服务提供方协议特定配合。其证据被解释为相对于独立指定并校准的匹配与非匹配操作情形的统计性证据,而非密码学证据。当前实例化针对 CNN 图像分类器,使用基于概率控制的见证生成,并在十个 ImageNet 预训练 TorchVision 模型上评估。
可获得的文本为摘要级信息,未包含具体阈值、挑战次数、分离度量或统计检验细节,因此无法从现有文本判断有限挑战次数验证的具体规模与稳健性。框架被描述为统计性而非密码学证据,其在不同模型架构、不同部署条件与不同攻击者策略下的表现仍是开放问题。
