跳到主要内容
返回时间线
Frontiers in Medicine来源发表:

防泄漏机器学习预测MOF载药与细胞活力:域内R²达0.774与0.557,但整篇文献留出后R²转负

核心概要

该研究基于Wang等人补充数据重建了161条载药量观测(110个描述符)与444条细胞活力观测(25个描述符),用差分进化在五折分组交叉验证中优化直方图梯度提升回归(HGBR)与偏最小二乘回归(PLSR),并把完全重复记录约束在同一数据分区以防信息泄漏;在防重复的20%留出集上,HGBR对细胞活力预测最强(R²=0.774,RMSE=11.655个百分点,MAE=8.153,AARD=16.69%),PLSR对载药量预测最好(R²=0.557,RMSE=0.345 g/g,MAE=0.210 g/g),但当整篇来源文献被留出时所有模型R²均为负(活力−0.391与−0.119,载药−0.342与−

Source-provided article image: Leakage-aware machine learning for data-driven performance prediction of metal–organic framework systems
第 2 页

深度剖析

研究把MOF药物递送的两个端点当作彼此独立的预测问题分别建模,而不是强行建立跨文献的行对应关系。 既往同类工作常把载药量与细胞活力放在同一套高精度流程中报告,本文明确区分两个端点各自的观测数与特征空间,并分别选择模型族。 活力数据444条、25个预测变量;载药数据161条、110个预测变量;两套矩阵的变量构成不同(活力含金属、连接体/官能团、细胞类别、zeta电位、粒径、暴露时间、浓度;载药含金属、连接体/官能团与66个分子指纹位)。

在防重复的20%留出集上,端点决定了更合适的模型:HGBR在细胞活力上取得R²=0.774、RMSE=11.655个百分点、MAE=8.153、AARD=16.69%,而PLSR在载药量上取得R²=0.557、RMSE=0.345 g/g、MAE=0.210 g/g。 与仅依赖随机行级划分的做法不同,本文把完全重复记录归入同一分组,并在训练折内重新拟合预处理参数,再由差分进化在分组交叉验证下选超参数。 活力HGBR的分组交叉验证R²=0.723、留出R²=0.774,训练R²=0.970高于交叉验证值;载药PLSR的分组交叉验证R²仅0.071而留出R²=0.557,说明单一留出集比若干交叉验证折更易预测。

当整篇来源文献被留出时,所有模型R²均为负,说明模型学到的是已收录材料与实验区间内的插值关系,而非跨出版来源的迁移关系。 这一压力测试与主留出集回答不同问题:前者估计已编译数据所覆盖范围内的插值,后者探测合成、测量、配方与报告实践变化下的迁移。 活力R²为−0.391(HGBR)与−0.119(PLSR),载药R²为−0.342(HGBR)与−0.679(PLSR);负R²意味着预测误差超过直接使用压力测试目标均值的误差。

置换重要性给出了各端点模型所依赖的变量:活力模型以浓度影响最大,其后为Zn、zeta电位、Fe、正常细胞状态与粒径;载药PLSR最敏感于2,5-dioxidoterephthalate与Mg相关描述符,其后为羟基官能团、Cr与部分分子指纹位。 作者强调这些排序反映的是拟合模型下的预测依赖,可能同时编码研究设计(特定MOF、细胞类别或浓度区间在文献中聚集),而非孤立的生物学机制。 每个预测变量被随机置换30次并记录RMSE的平均增幅;作者指出稀有二元指示变量在小数据集中可能获得高杠杆。

启示与展望

该框架面向已收录材料与实验区间内的候选排序,适用于希望用文献数据优先筛选MOF配方、而非替代载药量测定或细胞毒性实验的研究者;作者建议的下一步是定义标准化实验方案、记录不确定度与重复测量、纳入定量孔结构与稳定性描述符,并预留整间实验室或新制备批次做外部验证,待样本量支持后再引入基于图的药物与骨架嵌入表示。

原文为不完整读取,图1至图5的具体内容与公式1至7的完整形式未包含在已加载文本中,因此无法核对分布形态、残差结构与优化轨迹的细节;此外,活力表缺少明确的药物身份或分子指纹变量,载药表缺少暴露与生物学变量,两个端点无法合并为有效的双输出模型,二元结构指示变量也未覆盖孔体积、可及表面积、骨架缺陷、药物电离、溶剂组成与释放动力学,这些空白意味着跨来源预测能力仍需标准化前瞻测量来确认。

来源