基于图的QSAR建模流程:预测体外PubChem检测与体内人体肝毒性及Caspase-3/7激活机制分析
核心概要
该研究构建了一套基于图的QSAR建模流程,整合检测数据预处理、指纹与分子图特征表示,并基准测试经典机器学习、图神经网络、图变换器及其共识集成,用于预测Caspase-3/7激活、线粒体膜电位破坏和FDA药物性肝损伤,其中在DILI预测上Graphormer取得最高F1 0.79、全共识模型取得最高AUC 0.69,超过此前最佳模型的AUC 0.63与F1 0.65,并通过片段富集分析识别出与双重激活及细胞系特异性反应相关的结构基序。
深度剖析
提出并公开了一套端到端的基于图的QSAR建模流程,覆盖数据清洗、去重、特征表示与多类模型基准测试。 此前尚无QSAR研究系统比较指纹方法与图方法(GNN与GT)在Caspase和线粒体毒性预测上的表现,该工作填补了这一空白。 流程在19个qHTS检测、18个最终数据集和14种细胞系上实施,并公开了代码与数据;模型涵盖3个经典分类器、4个GNN、2个GT和4个共识模型。
在FDA药物性肝损伤基准上,图变换器与共识集成优于此前最佳模型。 Graphormer取得最高F1 0.79,全共识模型取得最高AUC 0.69,而此前最佳的多特征DILIPredictor为AUC 0.63、F1 0.65。 在222个化合物的留出测试集(155个肝毒性、67个非肝毒性)上评估,采用基于骨架的划分以降低训练测试相似性;Proxy+DILI设置一致优于Proxy-only。
通过跨检测机制分析识别出与Caspase与线粒体双重激活相关的结构基序。 此前研究将13种细胞系合并为泛Caspase毒性,未区分细胞类型差异;该工作识别出16个显著富集片段,包括对羟基苯基(padj=5.0×10⁻⁷)和亲脂链家族。 BRICS片段富集结合单侧Fisher精确检验与Benjamini–Hochberg校正,对比144个双重激活与2,628个双重非激活化合物;反向分析无显著命中。
识别出细胞系特异性的Caspase-3/7激活结构基序。 HEK293独有1,1-二氯乙烷和氯苯,SK-N-SH独有环氧化物片段,H-4-II-E独有四甲基环己烯和乙醛片段,提供了跨细胞系差异的细粒度证据。 在8个细胞系上应用BRICS富集,FDR设为α=0.10以应对小样本(n=10–19);HepG2、CHO-K1、Jurkat和SH-SY5Y未返回显著片段。
启示与展望
该流程适用于具有公开qHTS浓度-反应数据的毒性终点,尤其是活性化合物数量较多时(如线粒体毒性检测中超过1,400个活性化合物)表现较强;在活性化合物稀少且类别极度不平衡时(如Caspase-3/7数据集)预测性能受限。适用域分析显示,将预测限制在域内化合物可提升性能(ROC-AUC从0.91升至0.93),域外化合物代表结构新颖骨架,需实验确认。该框架面向计算毒理学研究者与药物安全性评估人员,用于毒性优先级排序与机制假设生成。
Caspase-3/7数据集的F1值较低(0.08–0.21),在类别极度不平衡下减少假阴性仍是开放问题;Graphormer在HepG2 Caspase数据上表现异常偏低,作者未给出明确原因;细胞系特异性基序分析中部分细胞系样本量小(n=10–19),FDR阈值放宽至α=0.10;体外模型向体内肝毒性泛化能力有限,作者提出未来将结合文献挖掘与LLM方法改进。读者可关注这些方向后续是否有更大规模数据与外部验证。
