药企私有蛋白结构数据显著提升AI折叠模型表现
核心概要
一个由多家制药公司组成的AI结构生物学网络(AISB)在仅用PDB数据预训练的OpenFold3基础上,用来自五家公司的20,167个蛋白-配体复合物结构进行微调,在留出的1,056个蛋白-配体结构测试集上使高精度预测比例超过一半,而公开版OpenFold3约为三分之一、开源模型Boltz-2约为40%,同时该模型也优于仅用各公司自有数据训练的模型,说明数据汇聚比数据孤岛更有价值。
深度剖析
用制药公司内部未公开的蛋白-配体结构微调OpenFold3,可明显提升对蛋白与小分子配体结合结构的预测准确度。 此前AlphaFold系列与OpenFold3主要依赖公开的蛋白质数据库(PDB)训练,而PDB中蛋白与类药物分子相互作用的实验结构相对稀少;该工作把药企内部结构纳入训练,直接针对这一数据缺口。 在1,056个从训练数据中留出的蛋白-配体结构上评估,AISB模型对其中一半以上达到高精度,公开版OpenFold3为约三分之一,Boltz-2约为40%;但该研究以博客文章形式描述,尚未经过同行评审,模型也未公开。
把多家公司的数据汇聚起来训练,效果优于各公司仅用自身数据分别训练。 这为“数据孤岛”与“数据共享”的相对收益提供了一个直接的经验对照,而不只是理论上的呼吁。 文中引述AbbVie计算药物发现负责人John Karanicolas的说法,AISB模型也优于仅用每家公司各自数据训练的共折叠工具;具体对比数值未在文中给出。
该结果被用来支持建设类似规模的公开数据集,以推动蛋白折叠与共折叠AI的发展。 把一次企业间合作的结果,转化为对公共数据基础设施投入的论据,并指向已在推进的OpenBind项目。 文中提到OpenBind项目获得最高800万英镑(约1,080万美元)英国政府资助,上月发布了数百个新蛋白结构,另有数千个在筹备中;这属于相关动向的陈述,而非该模型性能的直接证据。
启示与展望
该结果针对的是蛋白与小分子配体结合结构的预测,适用于拥有大规模内部结构数据的药企联合体或类似联盟场景;其价值在于说明在公开PDB数据之外补充专有结构能提升共折叠模型表现,并为OpenBind这类公开数据项目提供论据。对没有此类数据来源的研究者,短期内可获得的直接收益取决于公开数据集能否达到相近规模与多样性。
读者仍会关注:正式论文发表后,性能提升在不同靶点类别、不同配体化学空间上的稳健性如何;留出测试集与训练数据之间是否存在分布重叠;多家公司数据汇聚带来的增益有多少来自数据量、多少来自数据多样性;以及模型不公开的情况下,外部能否复现这一比较。文中未给出这些细节,因此目前只能把结论视为有前景的初步信号,而非已确立的共识。
