OpenLipid:面向脂质组学DIA质谱数据靶向分析的大语言模型工作流
核心概要
该研究提出OpenLipid,一个基于大语言模型(LLM)的靶向DIA脂质组学工作流:它用DDA结果构建assay库,在零样本设置下直接评估DIA数据的提取离子色谱图(XIC)以挑选目标脂质峰并给出可读的判定理由,在4个人血浆与小鼠粪便正负离子模式数据集上,5% FDR下识别率与DIAMetAlyzer总体相当(血浆55.3%/19.0%、粪便71.8%/31.8%),明显高于非靶向MS-DIAL DIA(12.6%/0.0%、47.5%/0.0%),且LLM给出的色谱特征可训练分类器区分正确与错误候选峰组(交叉验证平均精度中位数0.838-0.912)。
深度剖析
OpenLipid把LLM用于靶向DIA脂质组学的色谱证据评估,在零样本、无脂质组学专门训练或微调的条件下,直接从XIC中识别候选峰组并输出峰/无峰决策、峰边界与支持碎片离子。 此前ChatDIA已在靶向DIA蛋白质组学中验证了通用LLM评估XIC的可行性,本研究将该思路扩展到脂质组学,并系统评估其识别目标脂质信号的能力。 在4个基准数据集(SRM 1950血浆与小鼠粪便,正负离子模式)上与人工注释比较,每个脂质靶标独立分析并做3次重复运行(R0-R2)。
在5% FDR下,OpenLipid(LLM Majority集成)接受110、28、130、84个鉴定,对应库靶标的55.3%、19.0%、71.8%、31.8%,总体覆盖率与DIAMetAlyzer(57.8%、19.7%、89.0%、17.8%)相当,并显著高于非靶向MS-DIAL DIA(12.6%、0.0%、47.5%、0.0%)。 首次在脂质组学中给出LLM工作流与靶向(DIAMetAlyzer)及非靶向(MS-DIAL DIA)方法在同一assay库靶标上的FDR-覆盖率对照。 基于人工注释的真值,FDR定义为被接受鉴定中错误的比例,覆盖率定义为被接受的注释库靶标比例;正离子模式覆盖率一致高于负离子模式。
在1% FDR这一更严格阈值下,OpenLipid覆盖率为35.7%、12.2%、39.2%、22.7%,在4个数据集中的3个高于DIAMetAlyzer(33.7%、4.8%、70.7%、15.5%),且被接受的鉴定中未观察到错误候选。 说明LLM评分在低FDR区间仍具备候选排序能力,而MS-DIAL DIA在负离子模式数据集无任何操作点满足该阈值。 FDR-覆盖率曲线与精确率-召回率分析;OpenLipid平均精度为0.903、0.851、0.924、0.900,DIAMetAlyzer为0.865、0.732、0.960、0.738,MS-DIAL DIA为0.451、0.232、0.544、0.325。
LLM报告的单项色谱特征(保留时间一致性、离子共洗脱、峰形、碎片离子模式一致性及支持碎片离子数)可训练监督分类器区分正确与错误候选峰组,并在血浆与粪便之间双向迁移时保留预测信息。 表明LLM输出不仅可用于最终判定,还可作为下游统计建模的特征输入,且候选排序信息可跨样本类型迁移。 按脂质靶标分组的重复分层五折交叉验证(10次重复),LLM特征平均精度中位数0.838-0.912,DIAMetAlyzer特征为0.734-0.865,均高于0.117-0.270的候选流行率基线;外部验证中LLM特征平均精度中位数0.828-0.915。
启示与展望
该工作面向以DDA结果构建assay库、在DIA数据中评估预定义脂质靶标的靶向分析场景,适用于人血浆与小鼠粪便、正负离子模式、SCIEX ZenoTOF 7600平台采集的数据;其价值在于为脂质组学研究者提供FDR可控的自动化候选峰评估与可读判定理由,并可作为下游统计建模的特征来源。
评估仅基于单一仪器平台的4个数据集,跨实验室、采集设置与色谱条件的适用性有待建立;与MS-DIAL DIA的FDR对照限于assay库内靶标;工作流依赖MS-DIAL进行DDA鉴定与库构建,而MS-DIAL的脂质MS/MS注释不提供具体碎片身份,限制了LLM评估碎片证据时可用的结构信息;按名义FDR选定的分数阈值在新数据集上可能需要调整;需要更多运行次数与重复集成来确定所需运行数并量化残余变异。
