研究团队构建覆盖21种成人组织的单核多组学图谱,解析459,856个转录组与染色质可及性图谱并识别161,270个新调控元件
核心概要
该研究构建了一个单核多组学图谱,包含来自21种成人组织和4名供体的459,856个转录组与染色质可及性图谱(其中160,688个细胞核为配对测量),解析出9个细胞谱系、61种宽泛细胞类型和313个亚群,识别出1,085,062个候选顺式调控元件(含161,270个ENCODE未收录的新元件),并利用该数据训练序列到功能模型,对548,656个精细定位变异预测染色质可及性效应,识别出18,133个高效应变异(含1,120个广泛活跃变异)。
深度剖析
研究构建了覆盖21种成人组织、4名供体的单核多组学图谱,包含459,856个转录组和染色质可及性图谱,其中160,688个细胞核具有配对测量,解析出9个细胞谱系、61种宽泛细胞类型和313个亚群。 相比以往多组学参考图谱,该工作在同一细胞核内同时测量转录组和染色质可及性,并将覆盖范围扩展到21种成人组织,提供了更系统的跨组织细胞类型分辨率。 基于459,856个图谱和160,688个配对细胞核的大规模数据,覆盖21种组织和4名供体,数据规模和多组学配对设计为细胞类型解析提供了直接证据。
研究识别出1,085,062个候选顺式调控元件,其中161,270个为ENCODE未收录的新元件,并通过联合分析获得871,177个cCRE-基因关联,揭示谱系特异性调控架构。 新发现的161,270个元件扩展了已知调控元件目录,871,177个cCRE-基因关联将调控DNA与细胞表达直接连接,为解读非编码遗传风险提供了跨组织参考。 基于配对多组学数据的联合分析产生cCRE-基因关联,新元件通过与ENCODE目录比对确定,证据来自大规模跨组织数据。
跨组织可及性分析识别出谱系限制性和组成性不可及的染色质结构域,后者在人类癌症中表现出优先低甲基化。 将染色质可及性状态与癌症甲基化模式联系起来,提示组成性不可及区域可能具有跨癌症类型的表观遗传特征。 基于跨组织可及性比较和癌症甲基化数据的观察性关联,证据来自图谱数据的跨组织分析。
研究利用该数据集训练序列到功能模型,对548,656个精细定位变异预测染色质可及性效应,识别出18,133个高效应变异(含1,120个广泛活跃变异),并针对8种内皮亚型训练模型以解析血管床间的变异效应。 将图谱数据转化为可预测变异调控效应的计算模型,并针对内皮亚型细化预测,为复杂性状遗传学解读提供了计算框架。 基于548,656个精细定位变异的预测和18,133个高效应变异的识别,模型训练和预测均基于该图谱数据,内皮亚型模型覆盖8种亚型。
启示与展望
该图谱适用于21种成人组织和4名供体范围内的调控序列解读与变异效应预测,主要面向功能基因组学、遗传学和计算生物学研究者。序列到功能模型可用于对精细定位变异进行染色质可及性效应预测,内皮亚型模型适用于血管床相关变异效应解析。该资源为后续跨组织调控研究和复杂性状遗传学分析提供了参考框架。
当前文本为摘要和利益冲突声明,缺少图表、补充材料和完整方法细节,因此无法评估数据质量控制、模型验证策略和独立验证结果。读者可关注:配对测量在21种组织间的分布是否均衡、新调控元件的功能验证情况、序列到功能模型在不同人群和细胞类型中的泛化能力,以及组成性不可及区域与癌症低甲基化关联的机制解释。
