跳到主要内容
返回时间线
Nature来源发表:

药企私有数据为AI蛋白质模型带来显著提升

核心概要

一个由多家制药公司组成的AI结构生物学(AISB)网络,用来自五家公司的20,167个私有蛋白质-配体结构对开源模型OpenFold3进行微调,在1,056个留出的蛋白质-配体结构测试集上,该模型对超过一半的结构达到高精度预测,而公开版OpenFold3仅对三分之一达到同等精度、竞争性开源模型Boltz-2约为40%,同时该模型也优于仅用各公司单独数据训练的模型,说明汇集私有数据能明显提升蛋白质-配体相互作用预测能力。

Source-provided article image: Drug firms' secret data supercharge AI protein models.

Artificial-intelligence-based models of protein structure could be improved by incorporating data from pharmaceutical companies. Credit: Miyako Nakamura/Getty

PubMed

深度剖析

用20,167个来自五家药企的私有蛋白质-配体结构微调OpenFold3后,模型在1,056个留出测试结构上对超过一半达到高精度预测。 此前AlphaFold类模型主要依赖公开的蛋白质数据库(PDB)训练,而PDB中与类药物分子结合的实验结构可能仅约10,000个,私有数据此前未被用于此类模型的训练。 该结果来自AISB网络在博客文章中描述的未经过同行评审的研究,模型未公开;测试集为1,056个留出的蛋白质-配体结构,对比对象为公开版OpenFold3和Boltz-2。

公开版OpenFold3在相同测试集上仅对三分之一的结构达到高精度,Boltz-2约为40%,均低于AISB模型。 这提供了同一测试条件下公开数据模型与私有数据增强模型之间的直接性能对比。 对比数据来自同一篇博客文章,测试集规模为1,056个结构,但研究尚未经过同行评审。

AISB模型也优于仅用各公司单独数据训练的模型,说明汇集多家公司的数据比各自为战更有价值。 此前各药企的数据处于孤立状态,该结果首次展示了跨公司数据汇集在蛋白质折叠模型上的增益。 该结论由AbbVie计算药物发现负责人John Karanicolas在报道中提出,基于AISB网络的内部对比,具体数值未在文中给出。

启示与展望

该结果适用于药物发现中蛋白质-配体相互作用预测的场景,特别是当公开数据不足以覆盖目标化学空间时。它表明汇集多家药企的私有结构数据可以提升模型性能,为类似OpenBind这样的公开数据集项目提供了依据。对于能够获取或生成大量私有蛋白质-配体结构的团队,这一思路可能直接适用。

该研究尚未经过同行评审,模型未公开,因此无法独立验证其性能声明。博客文章未提供详细的训练细节、评估指标定义或统计显著性检验。此外,私有数据的总规模未知,不同公司数据的质量和多样性也未披露。读者可以关注后续同行评审论文的发表,以及OpenBind等公开数据集项目能否复现类似的性能提升。

来源