SemVac:以大型语言模型驱动的语义疫苗学范式用于抗原发现
核心概要
该工作提出“语义疫苗学”范式并实现为 SemVac:通过 PaperBLAST 检索每个蛋白相关文献,压缩为结构化语义档案,再提示大语言模型输出抗原性概率;在 246 蛋白细菌基准上,14 个通用大语言模型中最佳者达到或超过专用预测器 PLGDL 的精确度,开源权重 Kimi K2 0905 在性能与成本间最均衡,预测对疫苗关键词遮蔽稳健、重复推理可复现,并泛化到 1200 蛋白跨病原体数据集;显式思维链推理在所有测试模型中提高召回但降低精确度;应用于 mpox 病毒蛋白组时复现已知抗原谱并优先排序未表征候选,其中 A30L 与 C19L 获得近期正痘病毒疫苗开发的独立实验支持,而 B20R 出现与 curated 注释不符的连贯但错误的 T
深度剖析
提出并实现“语义疫苗学”范式,把已发表文献作为序列与结构之外的第三种显式、可审计模态用于保护性抗原预测。 既有反向疫苗学方法主要依赖序列与结构,忽略文献中记录的功能与免疫学知识;SemVac 通过 PaperBLAST 检索蛋白相关出版物、压缩为结构化语义档案并提示大语言模型给出抗原性概率,使文献证据成为可追溯的预测依据。 以 246 蛋白细菌基准与专用蛋白语言与几何深度学习预测器 PLGDL 对比,14 个通用大语言模型中最佳者达到或超过 PLGDL 的精确度;预测对疫苗关键词遮蔽稳健、重复推理可复现,并泛化到 1200 蛋白跨病原体数据集。
在性能与成本之间给出可操作的大语言模型选择参考:开源权重 Kimi K2 0905 表现最均衡。 该比较覆盖 14 个通用大语言模型,而非单一模型演示,为实际部署提供了成本与性能权衡的经验依据。 基于同一 246 蛋白细菌基准的横向评测,并报告 Kimi K2 0905 在性能与成本间取得最强平衡。
发现显式思维链推理在生物评分中会“过度推理”:所有测试模型中召回上升而精确度下降。 这一反直觉结果提示,在抗原性打分这类任务上,增加显式推理步骤并不必然提升判别质量,为提示设计提供了方向性证据。 在全部受测模型中一致观察到召回提高、精确度降低的模式。
在 mpox 病毒蛋白组上复现已知抗原谱并优先排序未表征候选,同时展示虚构可被检测与纠正。 A30L 与 C19L 获得近期正痘病毒疫苗开发的独立实验支持,构成外部验证;B20R 则产生与 curated 注释不符的连贯但错误的 TNF 诱饵叙述,说明交叉核对推理轨迹可暴露模型虚构。 外部验证来自近期正痘病毒疫苗开发的独立实验支持;虚构检测通过将推理轨迹与 curated 资源交叉核对实现。
启示与展望
该范式面向从病原体蛋白组中筛选保护性抗原的研究与早期发现场景,适用于能够为每个蛋白检索到相关文献、并可构建结构化语义档案的情形;其价值在于把文献证据变成可审计的第三模态,供疫苗靶点优先级排序使用。对文献覆盖稀疏的蛋白,语义档案的信息量会随之受限。
读者仍会关注:语义档案的构建在文献稀少或描述质量参差时如何影响抗原性概率;思维链导致召回升、精确度降的机制在更广任务上是否稳定;B20R 式虚构在缺乏 curated 注释可交叉核对的候选上如何被识别;以及 A30L、C19L 的外部实验支持在更大队列中的可重复程度。
