从经典分子描述符出发的低数据区制深度学习基础模型
核心概要
该研究提出一种新的基础模型预训练路径:在低噪声、可计算的分子描述符上以监督学习方式进行预训练,以获得丰富且高度可迁移的分子表征,并以约一千万参数的 CheMeleon 模型加以验证;在来自产业界 Polaris 基准计划的 58 个覆盖小分子药物发现相关性质的数据集上,CheMeleon 使有向消息传递神经网络在低数据区制下终于超过经典方法,并在严格统计比较中优于基于分子指纹与描述符的随机森林等经典基线以及已有基础模型,同时模型与预训练框架已开源。
深度剖析
提出以低噪声、可计算的分子描述符为目标的监督式预训练路径,用于获得可迁移的分子表征。 相对于以往以其他信号或目标进行预训练的做法,这里把预训练信号直接锚定在经典分子描述符上,为分子基础模型提供了一条新的预训练入口。 该策略以 CheMeleon 模型具体实现,并在 58 个基准数据集上进行了评估,属于有明确实现与多数据集验证的方法性贡献。
CheMeleon 使有向消息传递神经网络在低数据区制下首次超过经典机器学习方法。 此前深度学习在训练数据有限的真实世界基准上难以胜过经典方法,该工作报告了这一性能格局的转变。 结论基于 58 个数据集上的严格统计比较,并对照了基于分子指纹与描述符的随机森林等经典基线。
CheMeleon 在统计比较中同时优于已有基础模型。 不仅与经典基线比较,还与现有基础模型进行了对照,说明该预训练策略带来的增益并非仅相对于传统方法。 评估覆盖 58 个数据集并采用严格统计比较,模型规模约为 O(10M) 参数。
开源 CheMeleon 模型与预训练框架,以推动该预训练策略在化学各领域的采用与扩展。 将模型与框架一并开放,使该策略可被复现、迁移到其他化学任务并进一步扩展。 作为研究产出的公开释放,为后续采用与扩展提供了直接可用的基础。
启示与展望
该工作面向小分子药物发现相关性质的预测,评估范围是来自产业界 Polaris 基准计划的 58 个数据集,适用于训练数据有限的低数据区制场景;其价值在于为化学科学中采用与扩展该预训练策略提供可复用的模型与框架,尤其适合需要在数据稀缺条件下进行分子性质建模的研究与开发场景。
当前可获取的文本为摘要性内容,未包含具体数据集名称、各项指标数值、统计检验细节以及模型架构与预训练配置;因此读者仍会关注该策略在不同性质类型与不同数据规模下的表现边界,以及在其他化学领域扩展时的适用条件,这些有待结合原文的方法与结果部分进一步确认。
