隐私感知蒸馏大语言模型提升多病共存评分
核心概要
该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。
Figure 1: Overview of the CoLLM framework for multimorbidity risk prediction and
medRxiv · 第 7 页深度剖析
研究构建了CoLLM蒸馏流程:将ICD-10编码归并为263个父类疾病,用CTGAN生成50,000例训练和10,000例测试合成样本,教师模型在零样本提示下输出评分,学生模型为多层感知机回归网络,分别模仿单个教师和三者均值(LLM-Mean)。 相对以往直接向大模型输入患者数据或仅做规则化评分的做法,该工作把评分能力从闭源教师模型迁移到本地可部署的紧凑学生模型,从而绕开UK Biobank数据使用协议对第三方API的限制。 合成数据保真度由SDV框架评估,总体质量得分95.34%,列分布得分96.69%,列对趋势得分93.99%;疾病患病率在263个父类上与真实队列相关(Pearson r=0.73,p<0.001),疾病对共现相关为中等(Pearson r=0.58,p=1.50e-03)。
CoLLM在留出测试集上对教师评分的模仿达到较高一致性,其中LLM-Mean表现最好。 该结果量化了输出级蒸馏的保真度上限,并显示集成多个教师比模仿单一教师更稳定。 Spearman相关系数为0.75(CoLLM-DeepSeek)至0.89(CoLLM-Mean),CoLLM-Gemini为0.80、CoLLM-GPT-4o为0.77;R²为LLM-Mean 0.69、Gemini 0.50、GPT-4o 0.42、DeepSeek 0.24;CoLLM-Mean残差相关接近零(ρ=0.055),而单个CoLLM(尤其DeepSeek)在高分区间存在低估。
在真实UK Biobank数据上,CoLLM衍生评分在全因死亡风险区分度上优于CCI和ECI,并在遗传层面呈现可解释的关联。 该工作把大模型衍生评分与生存结局、遗传结构、多基因风险评分三类外部证据联系起来,而不仅是报告与教师模型的相关性。 中位随访4.8年(IQR 2.7–9.2),37,094例死亡事件;50–60岁组LLM-Mean的C-index为0.910(95% CI 0.906–0.915),高于CCI 0.895(0.889–0.900)和ECI 0.877(0.870–0.883);GWAS在HLA-DQA1/DQB1和LPA位点观察到一致信号;SNP遗传力估计为CCI 0.034±0.0023、DeepSeek 0.046±0.0026、Gemini 0.041±0.0023、GPT-4o 0.049±0.0025、LLM-Mean 0.048±0.0025;LLM-Mean在Bonferroni校正后识别30个显著PRS关联,多于CCI的22个和ECI的14个。
独立的LLM-as-Judge评估显示教师模型输出具有临床意义但方差较大,而蒸馏后的学生模型在临床一致性、评分可靠性和异常/安全风险上更稳定。 该评估为蒸馏模型提供了除数值相关性之外的定性维度证据,并显示学生模型可能比其教师更稳定。 由Claude Sonnet-4作为独立评审,在10,000例合成测试集上采用固定批次重测设计(10批×100例,每批评3次,每模型每维度30次重复);Krippendorff's alpha为临床一致性0.762、评分可靠性0.927、安全/异常风险0.859;CoLLM-DeepSeek相对教师DeepSeek在临床一致性(2.00到3.03)、可靠性(1.93到3.47)和安全/异常风险(2.57到4.00)上均有提升。
启示与展望
该框架面向需要在隐私与数据使用协议约束下利用闭源大模型能力的临床与流行病学研究场景,尤其是拥有大规模电子健康记录但无法将个体数据发送至第三方API的机构;其设计目标是让研究者在本地部署紧凑学生模型,对ICD-10编码与人口学变量生成多病共存评分,并用于生存风险分层、遗传关联和多基因风险评分分析。作者同时说明,教师模型仅接触CTGAN生成的合成档案,真实UK Biobank上的表现是通过CoLLM间接推断的,因此结果应被理解为当前研究设定下的可行性与潜在效用证据,而非跨所有人群、数据集或大模型系统的普适证明。
读者仍需关注若干开放问题:合成队列中高血压(合成73.1%对真实34.4%)和跌倒被高估、而一般症状与体征、关节病、缺血性心脏病和糖尿病被低估,这种分布偏差如何影响教师评分与学生蒸馏尚待进一步刻画;CTGAN未使用差分隐私训练,也未进行成员推断或属性推断等正式隐私审计,因此披露保护得分(0.77–1.00,基线0.50)应视为启发式风险评估;CoLLM模仿的是标量评分而非完整推理链,属于输出级蒸馏;教师相关性与LLM-as-Judge主要衡量一致性与稳定性而非临床正确性,可能继承教师或评审模型的偏差;此外GWAS仅限欧洲 ancestry 个体,且未开展跨族裔、社会经济地位或 ancestry 的公平性分析,外部多样队列验证与临床医生裁定仍是后续工作。
