跳到主要内容
返回时间线
Cancer Discovery来源发表:

MutationProjector 用 3 万余例肿瘤基因组预训练,在膀胱癌、肺癌和黑色素瘤中预测免疫治疗应答并锁定 KMT2D 与 SMARCA4-STK11 等标志物

核心概要

研究团队构建了基于图注意力网络、整合八类分子网络的肿瘤基因组基础模型 MutationProjector,在 30,328 例、10 种实体瘤的基因改变数据上以掩码基因重建进行自监督预训练,随后用随机森林在少量标注队列上迁移学习,在膀胱癌、肺癌、黑色素瘤免疫治疗应答预测中取得 HR 分别为 0.71、0.74、0.59 的生存分层,在顺铂化疗膀胱癌队列中 HR 为 0.43,并通过注意力分析提出 KMT2D 与 SMARCA4-STK11 等新候选标志物。

Source-provided article image: A Foundation Model of Cancer Genotype Enables Precise Predictions of Therapeutic Response.

(A, B) Datasets collected to pre-train MutationProjector, including (A) tumor genetic alterations and (B) molecular networks. CNA: Copy Number Amplifications, CND: Copy Number Deletions, DDRAM ( 65 ): DNA Damage Response Assemblies Map, ISLE ( 63 ): Identification of clinically relevant Synthetic LEthality, PCNet ( 23 ): Parsimonious Composite Network, SIGNOR ( 58 ): SIGnaling Network Open Resource, STRING ( 66 ): Search Tool for Retrieval of Interacting Genes/Proteins, TMB: Tumor Mutation Burden, TRRUST ( 59 ): Transcriptional Regulatory Relationships Unravelled by Sentence-based Text-mining. (C) Model configuration for pre-training. Solid black mutation embedding indicates alteration profiles that are masked. Updated embeddings are generated via network-based message passing using graph attention networks. Size of the gene and covariate embeddings are noted as d features . CNA: Copy Number Amplification, CND: Copy Number Deletion, Emb: Embedding, Norm: Normalization, TIL: Tumor Infiltrating Lymphocytes, TMB: Tumor Mutational Burden.

PubMed

深度剖析

MutationProjector 把肿瘤的 468 个临床 panel 基因改变状态、TMB、非整倍体和突变特征,经图注意力网络映射为可解释的定量嵌入,并用掩码基因重建作为自监督目标。 以往肿瘤基因组模型多针对单一任务或单一数据类型训练,这里把多类分子网络(物理互作、转录调控、磷酸化、泛素化、遗传互作、DNA 损伤修复、STRING、PCNet,共 19,789 条互作)与基因组协变量统一进一个预训练框架。 预训练在 30,328 例肿瘤上进行,按 80%/20% 划分训练与留出集(24,262/6,066);掩码基因突变状态预测的 AUPRC 为 0.21,随机猜测为 0.02,提升 9.7 倍,并在外部队列中保持相近表现。

预训练嵌入在未提供相关标签的情况下,自发区分组织类型、鳞癌聚类、HPV 状态以及膀胱癌和乳腺癌的 basal/luminal 转录亚型,并保留关键驱动基因改变信息。 这些结构并非由显式监督信号驱动:即使移除癌种预测任务,嵌入仍能分层主要癌种;HPV 状态和 mRNA 定义的亚型从未作为输入。 基于 UMAP 投影的嵌入分析,MSK-IMPACT 与 TCGA 两个数据集在潜空间中接近,提示批次效应较小;模型嵌入对 95.7% 的基因在组织类型之外仍有预测贡献。

同一预训练模型经少量标注样本微调后,在免疫治疗、化疗和转移相关多个独立队列中达到或超过现有标志物与经典机器学习方法的表现。 采用 1 模型/N 任务的范式,而非为每个任务单独建模;免疫治疗分类器仅用 94 例训练即可外推至膀胱癌、肺癌、黑色素瘤三个独立队列。 免疫治疗 HR 分别为膀胱癌 0.71(p=1.6×10⁻²)、肺癌 0.74(p=1.7×10⁻⁵)、黑色素瘤 0.59(p=5.8×10⁻³);化疗膀胱癌 HR=0.43(p=2.5×10⁻²);转移预测独立队列 AUPRC 0.84;全部临床任务合计 3,362 例患者。

注意力分析给出可解释的标志物清单,包括免疫治疗敏感相关的 KMT2D 与 SMARCA4 等染色质重塑因子,以及预测无应答的 KRAS-STK11、KEAP1-STK11、SMARCA4-STK11 共改变组合。 KRAS、STK11、KEAP1 单基因突变在无应答者中并不更常见,但其两两共改变更常见;模型高关注的基因对中 94% 不会被标准共突变分析优先选出。 基于注意力权重的线性探测与 Spearman 相关评估特征重要性;KRAS-STK11、KEAP1-STK11、SMARCA4-STK11 分别占预测无应答者的 14%、13%、10%。

启示与展望

该结果面向使用临床基因 panel 测序的实体瘤场景,预训练覆盖 10 种实体瘤(以乳腺癌、结直肠癌、非小细胞肺癌为主),下游任务聚焦免疫治疗、顺铂化疗与转移结局;对胰腺癌、前列腺癌、肉瘤等尚未纳入的癌种,以及液体活检等新场景,作者将其列为可扩展方向。适用对象是希望把常规 panel 数据转为治疗应答预测与标志物假设的研究者与临床转化团队。

临床验证队列规模有限(免疫治疗训练仅 94 例,化疗测试仅 42 例),HR 与 p 值基于这些队列,外推稳健性仍需更大规模前瞻性数据检验;KMT2D、SMARCA4-STK11 等标志物来自模型注意力分析,属于假设生成而非机制确证;嵌入维度、注意力聚合与特征重要性方法的具体细节依赖补充图表,若仅读正文,部分定量依据需回到补充材料核对。

来源