Merriam-Webster 收录 agentic、vibe coding 等 AI 词汇,Nature 同期报道 Google DeepMind 用 SynthIDBio 给 AI 生成蛋白质打水印
核心概要
Nature 报道称 Merriam-Webster 于九月新增 agentic、AGI、natural language processing、prompt engineering、vibe coding 等 AI 与计算术语以及 biohack、direct air capture、geoengineering、uncanny valley 等技术词,词典编纂者 Peter Sokolowski 指出这批词需要较专业知识才能理解,认知科学家 Lera Boroditsky 认为技术加速推动语言变化;同一证据包中的 Nature 论文则提出 SynthIDBio,用 SynthID-text 的 tournament sampling 改造 Prote
深度剖析
Merriam-Webster 在线词典九月新增一批 AI 与技术词条,包括 agentic、AGI、compute(名词)、natural language processing、prompt engineering、vibe coding,以及 biohack、direct air capture、geoengineering、uncanny valley。 这批词条被词典编纂者 Peter Sokolowski 描述为需要较高级知识才能解释,例如“不懂 programming 就无法解释 vibe coding”,他把这归因于数字传播让非专业人士接触到高度技术化的术语。 依据是 Nature 新闻报道中转述的词典新增词表与 Sokolowski 的访谈表述,属于语言使用现象的报道性证据,而非实验数据。
认知科学家 Lera Boroditsky 认为技术创新常驱动语言变化,当今技术变革速度可与工业革命相比甚至更快,社会越复杂就越需要“紧密打包的意义单元”来高效谈论复杂事物。 这为词典收录技术词提供了语言与认知层面的解释框架,把词条扩充与技术进步速率联系起来。 来自研究者对语言与认知研究的评论性表述,报道未给出具体实验、样本或统计量。
Google DeepMind 团队提出 SynthIDBio 系列方法:SynthIDBio-sequence 把 SynthID-text 的 tournament sampling 接入 ProteinMPNN,在采样阶段嵌入水印并按校准到目标假阳性率的 g 值阈值过滤;SynthIDBio-structure 则微调 AlphaFold 3 的扩散模块并联合训练一个 PointNet 风格的水印检测器。 论文称此前并行的蛋白质序列水印工作仅停留在计算机模拟、使用 PDB 野生型单体结构,而结构水印方法会带来明显精度下降,因此“保功能的水印”此前尚不可得。 方法细节在正文与 Methods 中给出,包括 H=4、L=25、温度 0.1/0.3/0.5、损失权重 w_wm=0.1、噪声尺度 s∈{0.001,0.01,0.1} Å,以及约 350 万条序列的假阳性率校准集。
体外验证显示水印未破坏结合功能:对 SC2RBD 得到低纳摩尔结合体,对 VEGF-A 和 PD-L1 得到亚纳摩尔结合体,水印与未加水印设计在结合亲和力分布和命中率上无显著群体差异,9 个阴性对照均无可检测结合;结构水印在 0.1% 假阳性率下真阳性率超过 99.8%,s=0.001 时 LDDT 与模板建模分数不低于 AlphaFold 3 基线。 这是把水印从计算机模拟推进到湿实验验证功能保持的一步,并给出结构水印在蛋白质、RNA、DNA 上的检测结果。 序列侧使用表面等离子共振测定解离常数、双尾 Wilcoxon 秩和检验与 Fisher 精确检验,每个靶点 15 个骨架、每种设置 6 个设计;结构侧在 AlphaFold 3 评测集上报告真阳性率与 LDDT、模板建模分数。
启示与展望
这项工作面向的是 AI 生成蛋白质序列与结构的溯源场景:SynthIDBio-sequence 适用于通过 ProteinMPNN 等自回归模型重测序的从头设计流程,SynthIDBio-structure 适用于以 AlphaFold 3 类扩散模型预测结构的流程,论文建议采用 s=0.001 的模型。论文设想的应用方包括核酸合成供应商、管理 PDB、UniProt、GenBank 等数据库的机构,以及部署托管式设计工具的开发者;作者强调这是技术概念验证,落地还需要密钥安全共享、假阳性率阈值调优与行业层面的协调和标准化。词典收录部分则面向普通读者与语言研究者,说明技术词汇进入主流语言使用的现象。
论文自述 SynthIDBio-sequence 是零比特水印、无法编码更多信息,且可被 ProteinMPNN 重测序攻击移除——基于 38,396 个结合体的攻击实验显示,在已知结合体并带结构过滤时估计命中率降至 97%(SC2RBD)、70%(PD-L1)、66%(VEGF-A),不带过滤时更低;结构水印对刚性变换和噪声稳健,但受约束弛豫(OpenMM 与 Amber99sb 力场)会破坏水印,且尚未研究与其他结构水印的可区分性。论文还指出,惩罚性使用水印的可行性受开源工具普及限制,恶意行为者可直接使用无水印工具。此外,本次证据包中的新闻报道为节选,正文在“Rapid spread”处中断,词典新增词条的完整清单与后续论述无法从所载文本确认;论文部分为摘要、正文与方法的节选,补充材料中的完整阈值与攻击结果未包含在内,因此上述数字应视为论文所述而非独立复核结果。
