跳到主要内容
返回时间线
Journal of Chemical Information and Modeling来源发表:

大语言模型在上下文中的分子性质预测:一项关于记忆与知识冲突的盲化研究

核心概要

该研究在三个 MoleculeNet 数据集(Delaney 溶解度、亲脂性、QM7 原子化能)上,用逐步减少可用信息的盲化流程,配合 0、60、1000 样本的上下文示例数量,评估 GPT-4.1、GPT-5、Gemini 2.5 三个家族共九个 LLM 变体,以判断其分子性质预测是真正的上下文回归还是对记忆目标值的逐字检索,并加入记忆实验的正负对照、多示例实验的结构参照基线以及自助法置信区间;结果显示在这些既有基准上没有逐字检索的证据,而盲化会暴露出预训练知识与上下文信息之间的冲突。

AI-generated editorial illustration: In-Context Molecular Property Prediction with LLMs: A Blinding Study on Memorization and Knowledge Conflicts

深度剖析

论文提出并实施了一套系统性的盲化评估框架,通过迭代减少可用信息来检验 LLM 的分子性质预测是否依赖记忆。 以往对分子性质预测的评估通常只报告预测精度,而该工作把“信息可得性”本身作为受控变量,用逐步盲化来区分真实上下文回归与记忆检索。 摘要说明该框架覆盖三个 MoleculeNet 数据集与九个 LLM 变体,并配有正负对照与自助法置信区间,属于方法层面的系统设计。

在 Delaney 溶解度、亲脂性、QM7 原子化能这三个既有基准上,未发现 LLM 逐字检索记忆目标值的证据。 这直接回应了广泛使用基准可能存在训练数据污染的担忧,把“污染是否被实际利用”从猜测转为可检验的问题。 结论基于记忆实验的正对照与负对照,以及全部结果的自助法置信区间,属于带对照的实证检验。

盲化实验揭示出预训练知识与上下文信息之间存在冲突。 该发现把研究焦点从“模型能否预测”推进到“当模型内部知识与提示中给出的信息不一致时会发生什么”,为理解上下文学习与预训练知识的相互作用提供了新视角。 证据来自逐步减少信息的盲化序列,并以 0、60、1000 样本的上下文示例数量作为信息可得性的额外控制。

论文为在受控信息可得性条件下评估分子性质预测提供了一个有原则的框架。 该框架把记忆检验、盲化设计与多示例控制整合在一起,可被后续研究复用于其他数据集或模型家族。 摘要明确说明该框架包含记忆实验的正负对照、多示例实验的结构参照基线以及自助法置信区间,构成可复现的评估协议。

启示与展望

该框架面向在受控信息可得性条件下评估 LLM 的分子性质预测,适用于希望区分记忆检索与真实上下文回归、并考察预训练知识与上下文信息冲突的研究者;其结论所依据的是 Delaney 溶解度、亲脂性、QM7 原子化能三个 MoleculeNet 数据集,以及 GPT-4.1、GPT-5、Gemini 2.5 三个家族的九个变体。

当前可见文本为论文的摘要与元数据,未包含具体数值结果、图表与实验细节,因此各数据集上的误差水平、盲化各阶段的具体表现以及知识冲突的具体形态仍属开放问题;此外,结论是否延伸到其他数据集、其他模型家族或其他分子性质,也需要后续工作检验。

来源