NVIDIA 联合 Google DeepMind 与 EMBL-EBI 开放发布 2800 多种病毒的蛋白质复合物预测结构,其中约 30% 的相互作用此前从未被记录
核心概要
NVIDIA 与 Google DeepMind、EMBL-EBI 等机构组成联盟,用 AlphaFold2 配合 NVIDIA BioNeMo 推理运行时推断出 2800 多种病毒的蛋白质复合物三维结构并开放存入 AlphaFold 数据库,同时开源生成这些结构的 BioNeMo 结构预测流程,其中约 30% 的蛋白质相互作用是科学界此前从未记录过的。
深度剖析
联盟开放发布了 2800 多种病毒的蛋白质复合物预测三维结构,任何科学家都可经 AlphaFold 数据库获取。 此前对数千种病毒缺乏结构知识,该数据集开始填补这一空白,并把覆盖范围扩展到研究较少的病毒。 基于 AlphaFold2 推断,并用 NVIDIA BioNeMo 推理运行时优化以扩展到数千个病毒蛋白质组;文中说明预测按置信度标注,高置信度预测可由实验方法验证。
新增数据中约 30% 的蛋白质相互作用是全新的,其相互作用形态从未出现在蛋白质数据库(Protein Data Bank)中。 为生物学界提供了此前未被记录过的相互作用形态,被描述为假设生成的引擎。 文中以与蛋白质数据库的比对作为这一比例的依据,未给出更细的统计方法。
NVIDIA 开源了用于生成该数据集的 BioNeMo 结构预测流程,使研究者可从蛋白质序列出发预测自有靶点的三维结构。 把生成数据集所用的 GPU 加速工作流本身也公开,而不只是公开结果数据。 文中说明该流程即生成数据集所用的工作流,并给出可访问入口。
该数据集被定位为面向全球开放的基础资源,尤其降低低资源地区科学家应对疫情的门槛。 与仅服务少数机构的结构资源相比,开放获取与覆盖研究较少的病毒扩大了潜在使用者范围。 来自 EMBL-EBI 与 Google DeepMind 相关人员的表述,属于项目定位陈述,而非独立评估结果。
启示与展望
该数据集面向需要病毒蛋白质复合物结构信息的研究者,包括疫苗与药物设计、病毒诊断以及基础生物学方向,也面向低资源环境中直接应对疫情的研究人员。其定位是提前储备结构知识,使科学家在下一个未知病原体出现时不必从零开始;预测结构按置信度标注,高置信度结果可由实验方法进一步验证,研究者也可用开源的 BioNeMo 结构预测流程为自己的靶点生成结构。
文中未给出预测结构的验证规模、准确率或与实验结构的系统比较,也未说明 30% 这一比例的具体统计口径;这些属于读者在评估该数据集可直接支撑多少下游结论时仍会关注的问题。此外,文中提到的高置信度预测可由实验验证,但未说明验证工作是否已开展。
