上下文学习遇上小分子性质预测:新型机器学习方法基准测试
核心概要
该研究系统基准测试了基于上下文学习的表格基础模型(TFM)在小有机分子性质预测上的表现,在11个数据集(回归任务、随机与结构感知划分、每个最多10000个分子)上将其与XGBoost、CatBoost、多层感知机等描述符方法及图方法比较,发现TFM在基线经过仔细超参数选择的情况下仍持续优于描述符方法,并与图方法(包括经化学数据预训练者)精度相当或更好,Uni-Mol2在部分实验中略优于TFM,而检索策略(对每个测试分子取Tanimoto相似度最近的500个邻居)在较大数据集和随机划分上带来进一步改进。
深度剖析
TFM在11个小分子性质预测数据集上持续优于XGBoost、CatBoost、多层感知机等描述符方法,即使基线经过仔细超参数选择。 此前表格基础模型主要在其他表格数据领域被评估,本研究将其系统引入小分子性质预测并与经典描述符方法直接对比。 覆盖11个数据集、回归任务、随机与结构感知划分、每个最多10000个分子,且对基线进行了仔细超参数选择,比较条件较为严格。
TFM的精度与图方法(包括经化学数据预训练者)相当或更好,而Uni-Mol2(基于3D原子坐标的预训练深度神经网络)在部分实验中略优于TFM。 将无化学预训练、仅用极简2D分子描述符的TFM与使用化学预训练和3D坐标的图方法放在同一基准下比较。 比较被有意设计为对TFM不利,因为TFM不使用任何化学预训练且依赖极简2D描述符、无特征工程,因此其表现更具参考意义。
检索策略可进一步改进结果:对每个测试分子,从训练集中选取Tanimoto相似度最近的500个邻居,在该局部子集上进行TFM推理,在相对较大的数据集和随机划分上取得改进。 将检索式局部推理引入TFM的小分子性质预测流程,作为提升精度的补充手段。 改进出现在相对较大的数据集和随机划分上,说明其效果与数据规模和划分方式相关。
启示与展望
该基准面向小有机分子的性质预测,覆盖回归任务、随机与结构感知划分、每个数据集最多10000个分子,比较对象包括XGBoost、CatBoost、多层感知机等描述符方法以及图方法(含经化学数据预训练者)。TFM在此设定下不使用任何化学预训练,仅依赖极简2D分子描述符且无特征工程;检索改进出现在相对较大的数据集和随机划分上。因此,该结果适用于这一分子类别、数据规模与划分方式的场景,为后续在更大规模或其他分子体系中的评估提供了起点。
读者可能仍会关注:TFM在超过10000个分子的更大数据集上的表现如何;检索策略在其他相似度度量或邻居数量下的效果;结构感知划分下TFM与图方法的差异是否稳定;以及Uni-Mol2略优的实验具体出现在哪些条件下。由于当前为摘要级阅读范围,未包含图表与逐数据集结果,上述细节无法从现有文本中确认,属于待进一步查看原文的开放问题。
