跳到主要内容
返回时间线
arXiv来源发表:

DeepMind 给 AI 设计的蛋白质嵌入 SynthIDBio 水印,绑定病毒、血管与免疫靶点仍保持活性,但换一个设计工具即可抹除

核心概要

谷歌 DeepMind 团队开发了 SynthIDBio,把统计水印同时写入 AI 设计蛋白质的氨基酸序列与三维结构,在不明显损害功能的前提下标记其“由 AI 生成”的来源;团队称水印蛋白对病毒侵染、血管生成和免疫调控相关靶点的结合效率与未加水印版本相当,但该标记在多数情况下可被另一个设计工具重新生成序列后擦除,因此被视为生物安全分层防护中的一层而非单一解决方案。

AI-generated editorial illustration: Secret watermark labels proteins as ‘made by AI’

深度剖析

SynthIDBio 把水印同时编码进蛋白质的氨基酸序列模式与原子排布的三维形状,检测需要持有仅向可信伙伴(如 DNA 合成商)共享的秘密检测密钥,水印本身只揭示“该蛋白由 AI 工具设计”这一条信息。 此前的水印思路多用于图像、视频、音频和文本,FoldMark 等工作尝试把可追溯签名嵌入蛋白质结构;SynthIDBio 的差异在于把标记同时落在序列与结构两个层面,并直接挂接到 AlphaFold、RFdiffusion 这类设计工具的输出上。 Nature 报道描述该系统由 DeepMind 在伦敦的团队开发,并称其“借用”了已用于图像、视频、音频和文本的识别技巧;报道未给出水印容量、比特准确率或检测阈值的具体数值。

DeepMind 的 Pushmeet Kohli 团队对方法做了压力测试,发现加水印的蛋白质能够以与未加水印版本相当的效率结合多种靶点,包括与病毒感染、血管形成和免疫调控相关的靶点。 这回应了水印能否在不干扰蛋白质设计功能的前提下使用这一关键前提,把“标记”与“功能”的冲突从假设变为可检验的问题。 报道引述 Kohli 称团队“在若干具有挑战性的问题上对方法进行了压力测试”,并给出结合效率相当这一结论;报道未披露靶点数量、实验体系或统计细节。

该水印可以被擦除:想要抹掉“由 AI 生成”标签的人,在很多情况下可以把水印蛋白再送入另一个设计工具,生成一个保留结构与功能、但掩盖合成来源的新序列。 这把水印的定位从“判定真伪的开关”调整为分层生物安全框架中的一层,与 Alexanian 等人主张的从序列匹配转向功能筛查的思路形成互补。 报道以“The catch is that this molecular stamp can be scrubbed away”直接陈述这一限制,并引述 Tessa Alexanian 称其为“wild new world”中的又一件工具;报道未量化擦除成功率。

配套论文从治理与技术两侧给出背景:130 位跨产业、政府、学术与政策受访者中,76% 强调生物领域 AI 误用的紧迫性、74% 呼吁更清晰的治理标准、47% 对现有序列筛查工具表示怀疑;FoldMark 报告在 32 比特下超过 95% 的水印比特准确率、结构质量影响很小(scTM > 0.9),并在 EGFP 与 CRISPR-Cas13 湿实验中显示野生型水平功能(98% 荧光、95% 编辑效率)与 >90% 水印检出。 这些工作把水印从概念推进到可测量的指标与湿实验验证,同时把“序列相似性筛查不足以覆盖 AI 设计产物”这一判断落到专家共识与具体工具性能上。 专家比例来自 130 次半结构化访谈的编码统计;FoldMark 的数字来自其摘要自述的比特准确率、scTM 与湿实验功能指标;两者均为各自文本中的报告值。

启示与展望

该结果面向的是使用 AlphaFold、RFdiffusion 等 AI 工具设计蛋白质的研究者、DNA 合成商与生物安全筛查方,前提是检测密钥只在可信伙伴之间共享。它最直接的应用场景是标记 AI 生成蛋白的来源、辅助合成订单筛查与数据库溯源;报道明确指出它只揭示“由 AI 工具设计”这一条信息,因此适合作为分层防护中的一层,与功能筛查、访问控制和元数据溯源配合使用。

报道未给出水印容量、检测灵敏度与假阳性率,也未量化“另一个设计工具”擦除水印的成功率,因此水印在实际订单流中的可靠性仍是开放问题。配套文献提示了更广的图景:序列相似性筛查在序列同一性与最长公共子序列下降到一定阈值后检出率明显下滑,功能筛查仍处于从毒素等可处理靶点起步的阶段,而 130 位受访者中 47% 对现有序列筛查工具存疑。这些线索共同指向一个尚未回答的问题:当设计工具能产出与已知序列差异极大的功能性蛋白时,水印、功能预测与订单上下文信息应如何组合才能形成可靠判定。

来源