medRxiv 2026年9月21日该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。隐私感知蒸馏大语言模型提升多病共存评分该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。