SHERLOCK 将扰动效应建模为潜状态上的结构化干预,在 CRISPR、化学与空间扰动数据中恢复通路关系并预测组合效应
核心概要
作者提出 SHERLOCK,一个可解释的深度生成框架,把遗传与药物扰动表示为潜基线细胞状态上的结构化干预,学习相关且稀疏的扰动表征,并在显式可识别性假设下对下游转录效应做反事实估计,同时量化条件依赖响应并以组合方式建模组合扰动;在基因组规模 CRISPR、化学与空间扰动数据上,该框架恢复了与已知生物通路和药理性质一致的扰动关系,识别出条件依赖响应,并预测了组合扰动效应。
Figure 1: SHERLOCK: a generative framework for disentangling perturbation effects in single- cell data. (a) Overview of SHERLOCK. Single-cell gene expression data, together with perturbation and condition labels, are modeled using a structured variational autoencoder (VAE) to disentangle perturbation effects, context-dependent responses, and combinatorial interactions. (b) Plate diagram of the SHERLOCK generative process. Uncolored circles denote inferred variables, colored circles denote observed variables, and squares denote observed constants. (c) Main functionalities of SHERLOCK. (d) Left: UMAP of the original gene expression space from the Replogle dataset, colored by pathway-level annotations. Middle: UMAP of the original gene expression space, colored by Leiden clusters. Right: SHERLOCK latent representation of the same cells, colored by pathway-level annotations. (e) Correlation matrix of the learned perturbation embedding. Reference pathway annotations were annotated by Replogle et al., whereas mapped pathways were inferred from SHERLOCK groupings. (f) Gene set enrichment analysis (GSEA) of the inferred down- stream target genes for each perturbation group, highlighting pathway-relevant functional signatures. Color indicates −log10-transformed adjusted p-values, and point size represents the number of overlapping genes between the inferred target genes and enriched pathways. (g) Benchmarking of SHERLOCK on the Replogle
bioRxiv · 第 6 页深度剖析
SHERLOCK 把扰动效应表示为潜基线细胞状态上的结构化干预,从而学习到相关且稀疏的扰动表征,并按共享转录响应把遗传与药物扰动组织起来。 既有计算方法通常面向单一任务,例如预测扰动响应、刻画下游转录效应或建模扰动组合,缺少统一框架;该工作把可解释扰动表征学习与下游因果分析、条件依赖响应刻画放进同一框架。 摘要说明该表征在基因组规模 CRISPR、化学与空间扰动数据上恢复了与已知生物通路和药理性质一致的扰动关系;具体模型细节与定量指标未在加载文本中给出。
通过把扰动表述为结构因果模型中的干预,SHERLOCK 在显式可识别性假设下实现对下游转录效应的反事实估计。 这使扰动分析从单纯的相关性预测扩展到反事实层面的因果推断,且可识别性假设被明确写出。 摘要陈述了该因果表述与可识别性假设;加载文本未包含假设的具体形式或验证实验细节。
同一框架可量化扰动响应在不同条件间的变化,并以组合方式建模组合扰动,支持对留出组合的预测和遗传相互作用的分类。 条件依赖响应刻画与组合扰动建模此前多由不同方法分别处理,此处被统一到同一生成框架中。 摘要报告在 CRISPR、化学与空间扰动数据上识别出条件依赖响应并预测了组合扰动效应;具体数据集规模与评估指标未在加载文本中给出。
启示与展望
该工作面向单细胞扰动实验场景,适用于需要同时获得可解释扰动表征、下游效应因果分析与条件依赖响应刻画的研究者,例如使用基因组规模 CRISPR 筛选、化学扰动或空间扰动数据的团队。其反事实估计的适用性以摘要所述显式可识别性假设为前提,组合扰动预测面向留出组合,遗传相互作用分类面向可组合建模的扰动对。
加载文本为不完整摘要,未包含图表、具体数据集规模、基线对比与定量结果,因此无法判断反事实估计在实际数据上的精度,也无法确认可识别性假设在何种条件下成立。读者可关注:结构化干预表征与稀疏性约束的具体形式、条件依赖响应在不同条件设定下的稳定性,以及组合扰动预测在留出组合上的泛化表现。此外,作者声明与所述方法相关的临时专利申请,读者在评估应用前景时可留意这一点。
