跳到主要内容
返回时间线
Nature News来源发表:

AlphaFold数据库新增逾8000个病毒蛋白二聚体,并上线大流行防范门户

核心概要

2025年9月24日,研究人员向AlphaFold蛋白质结构数据库新增了来自23个病毒家族、共8000多个病毒蛋白二聚体预测结构,作为新设“大流行防范门户”的一部分;这些结构由AlphaFold2生成,源自对约2800种病毒、41774个蛋白序列的分析,其中2749个同源二聚体和5279个异源二聚体被认为足够准确而收录。

AI-generated editorial illustration: AlphaFold 'goes viral': database adds protein complexes of common viruses

深度剖析

病毒蛋白复合物首次成规模进入AlphaFold数据库:新增8000多个病毒蛋白二聚体,覆盖23个含人类感染成员的病毒家族,并作为“大流行防范门户”上线。 此前该数据库虽已收录约170万对来自20种常见研究生物(含人、小鼠、结核分枝杆菌)的相互作用蛋白对,但病毒一直是覆盖盲区;此次把复合物预测扩展到病毒,填补了这一空白。 报道给出明确数量:8000多个二聚体、23个病毒家族、上线日期为9月24日;数据库由欧洲分子生物学实验室欧洲生物信息研究所(EMBL-EBI)维护,用户超过300万。

研究流程从序列界定入手:瑞士生物信息学研究所的研究人员先为数千个从多聚蛋白上切下的病毒蛋白确定准确序列,全球多个机构的研究者随后分析了约2800种病毒的41774个蛋白序列,包括mpox、麻疹和乙肝病毒。 报道指出,由于部分病毒RNA先翻译成多聚蛋白再被切割,从基因序列难以判断单个病毒蛋白的起止,容易导致结构预测不完整;先厘清切割边界再预测,是针对这一困难的专门处理。 报道引述格拉斯哥大学分子病毒学家Joe Grove的说法解释多聚蛋白切割问题,并给出41774个蛋白、约2800种病毒的具体规模。

预测规模远大于收录规模:用AlphaFold2预测了40746个同源二聚体和近170万个异源二聚体,但只有2749个同源二聚体和5279个异源二聚体被认为足够准确而进入数据库,其余预测仍公开可得。 这区分了“做出预测”和“达到收录标准”两个层次,说明数据库条目是经过准确性筛选的子集,而完整预测集合另行公开。 报道给出成对的预测数与收录数,并说明未达标准的预测同样公开。

报道明确列出当前预测的边界:预测结构缺少修饰许多病毒蛋白、帮助其逃避免疫识别的糖分子;许多病毒蛋白以大于二聚体的复合物形式工作,例如SARS-CoV-2等冠状病毒的刺突蛋白和HIV的包膜进入蛋白都是三个相同蛋白组成的三聚体,这类复合物的二聚体预测在很多情况下因准确性不足而未收录。 这把新增数据的适用范围限定在二聚体层面,并指出糖基化与更高阶组装尚未纳入。 由参与该工作的Grove直接说明,并以刺突蛋白与HIV包膜蛋白的三聚体构成为例。

启示与展望

这项工作面向需要病毒蛋白结构线索的研究者,尤其是研究mpox、麻疹、乙肝等病毒的团队,以及做抗病毒靶点与疫苗相关分析的人员;适用场景是二聚体层面的结构预测查询,且预测结果免费公开。报道同时说明,未达准确性标准的预测虽未进入数据库但仍可获取,因此使用者可以在数据库条目与完整预测集合之间选择。

报道未说明准确性判定的具体标准,也未给出各病毒家族条目的分布;糖基化缺失与更高阶复合物(如三聚体)未纳入,意味着基于这些预测推断完整病毒蛋白行为时仍需谨慎。此外,本次证据包未附任何论文,全部信息来自新闻报道,因此无法核对原始方法细节与数据表。

来源