机制信息机器学习框架用XGBoost预测聚合物长效注射剂释放(测试R²=0.9774),并发现预测重要性与干预效应几乎不相关(r=0.132与−0.021)
核心概要
该研究构建了一个机制信息机器学习框架,把药学知识驱动的有向无环图、因果结构发现(PC、NOTEARS、DirectLiNGAM)、XGBoost释放预测、可解释AI(SHAP)与ATE/CATE干预效应估计及反事实制剂分析串联起来,在181条释放曲线、3783个分数释放测量、43个药物-聚合物配对的公开数据集上,XGBoost取得测试R²=0.9774、RMSE=0.0491、MAE=0.0339,并发现相关性与SHAP重要性高度一致(r=0.761),而二者与干预效应估计的一致性很低(r=0.132与−0.021),说明预测上有用的变量与可干预的变量并不相同。
FIGURE 1 Distribution of representative features before and after standardization.
· 第 4 页深度剖析
框架把药学领域知识以人工构建的有向无环图形式作为机制先验,再与数据驱动的因果发现结果融合,形成共识图用于后续效应估计。 以往聚合物长效注射剂的机器学习研究主要停留在预测精度与特征重要性,因果发现、处理效应估计与虚拟制剂优化通常被分开研究;该工作把它们放进同一条流水线。 知识图含29条边,相关性图122条边,互信息图205条边,共识图保留100条边(仅保留在三个来源中至少两个出现的边),并报告了图间Jaccard相似度作为重叠度量。
XGBoost在累积释放预测上表现最好,测试集R²=0.9774、RMSE=0.0491、MAE=0.0339,且训练-测试泛化差距最小,被选为下游可解释性与反事实分析的主模型。 在五种集成模型(RandomForest、GradientBoosting、XGBoost、LightGBM、CatBoost)的同一数据划分比较中,XGBoost在验证集与测试集上均最优,CatBoost最弱(测试R²=0.9337)。 70/15/15训练/验证/测试划分,固定随机种子,5折交叉验证;表2给出各模型在训练、验证、测试与全量数据上的R²、MAE、RMSE、MAPE。
相关性与SHAP重要性高度一致(r=0.761),但二者与干预导向效应估计的一致性很低(相关性对因果效应r=0.132,SHAP对因果效应r=−0.021),表明预测重要性与干预相关性是不同量。 这直接回应了论文提出的核心问题:最具预测力的变量是否也是最有效的制剂干预靶点;结果显示二者并不重合,仅靠传统可解释机器学习不足以支撑制剂决策。 三种重要性向量(绝对相关、TreeSHAP平均绝对SHAP值、Stage-4的因果效应)归一化到[0,1]后做两两Pearson相关,结果见表4。
反事实与干预分析给出可比较的虚拟制剂场景:时间对释放的效应方向在四种估计器(DoWhy、DML、Causal Forest、Linear DML)中一致为正,但幅度在0.1860至0.3790之间变化;多特征场景预测释放从0.212升至0.917,基线为0.442。 把因果效应估计转化为可操作的虚拟实验优先级排序,并明确效应幅度依赖估计器而非单一确定值,同时CATE分布显示同一因素在不同制剂中影响不同。 四种估计器估计同一(处理、结局、混杂)三元组;时间按经验百分位扫描(P0至P100)时预测释放从−0.001升至0.890,均在观测范围内属插值;作者强调这些是模型预测而非实验因果证据。
启示与展望
该框架面向聚合物长效注射剂(主要为PLGA微球或圆柱形植入剂,另含PLA与PCL)的累积释放预测与虚拟制剂筛选,适用于数据特征范围内的插值场景。对制剂开发者与实验设计者而言,它可用于在实验室验证前比较候选制剂改动、排序优先实验,并识别哪些变量值得作为干预靶点;对方法学读者,它提供了一条把领域知识图、因果发现与效应估计串联的可复现流水线(各阶段输出按编号保存,便于追溯)。
作者明确指出反事实效应仍是计算预测,不能替代实验因果证据,未来需通过实验验证、独立制剂数据集评估、不确定性量化与更强的图学习方法加以检验。读者还需注意:干预效应幅度随估计器不同在0.1860至0.3790之间变化,应视为估计器依赖而非单一确定值;时间扫描限于观测范围,属插值而非外推;本次读取为不完整范围,图4至图14的具体图形内容与部分算法细节未能完整核对,若需引用具体图形证据应回到原文。
