单中心1319例冻胚移植数据:可解释XGBoost模型预测临床妊娠,时间验证AUC由0.854降至0.722
核心概要
研究者在广东省中医院回顾性纳入1319例首次冻融胚胎移植患者,按移植日期分为训练队列(1013例)与时间验证队列(306例),用LASSO筛选出年龄、流产次数、周期类型、优质胚胎数、移植胚胎数、内膜变化、BMI、窦卵泡计数、移植日内膜厚度和取卵-移植间隔等变量,建立XGBoost模型并与logistic回归对比,XGBoost在训练队列AUC为0.854(95% CI 0.832–0.877)、时间验证队列为0.722(95% CI 0.666–0.779),对应AUPRC为0.840与0.707,验证队列校准可接受(Brier 0.212、截距0.056、斜率0.965),决策曲线显示在临床相关阈值范
(Figure 1). The final variables included in the model were age, induced abortions, cycle type, good-quality embryos, transferred embryos, endometrial change, BMI, AFC, embryo transfer-day ET,
· 第 4 页深度剖析
在单中心1319例冻胚移植队列中,XGBoost模型对临床妊娠的区分度在训练队列为AUC 0.854、时间验证队列为0.722,AUPRC分别为0.840与0.707,验证队列校准指标为Brier 0.212、截距0.056、斜率0.965。 既往用于冻胚或IVF妊娠结局的回归模型区分度多报告在0.60–0.70区间,本文在同一队列内同时报告了区分度、校准与决策曲线三类指标,并给出时间验证结果。 回顾性单中心研究,训练1013例、时间验证306例,共642例临床妊娠(含11例异位妊娠);内部验证用1000次bootstrap估计置信区间,时间验证队列不参与特征选择与调参。
XGBoost在时间验证队列的AUC数值上高于logistic回归(0.722 vs 0.690),但DeLong检验差异无统计学意义(P=0.090);在0.30阈值下,训练队列XGBoost敏感度更高(0.969 vs 0.918),而验证队列logistic回归略高(0.941 vs 0.928)。 作者没有把数值上的领先表述为稳定优势,而是明确指出阈值依赖的分类表现会随队列变化,并据此提示不应解读为某一模型持续更优。 两模型在同一训练与时间验证队列上比较,报告AUC、AUPRC、校准与DCA;敏感性分析显示连续变量logistic模型C指数0.690、限制立方样条模型0.717,均低于XGBoost。
SHAP分析显示对预测影响最大的变量依次为窦卵泡计数、优质胚胎数、年龄、内膜变化、周期类型、孕酮前内膜厚度、取卵-移植间隔与BMI,移植胚胎数与流产次数贡献很小;较高AFC与更多优质胚胎对应更大SHAP值,年龄为负向关联,BMI呈中间值预测概率较高的非线性模式。 模型除常用预测因子外还纳入了“内膜变化”(移植日内膜厚度减孕酮前内膜厚度,分为下降≤−1 mm、稳定−1至+1 mm、增加≥+1 mm),用以刻画内膜从准备到移植前的动态轨迹,而非单次静态厚度。 SHAP条形图、蜂群图与个体瀑布图提供特征层面与个体层面解释;作者说明SHAP反映的是关联而非因果,并提示AFC的作用可能是间接的。
决策曲线分析显示两模型在训练与时间验证队列中均高于“全部治疗”与“不治疗”参考线,在验证队列中相比全部治疗策略,XGBoost每100例约减少4例真阳性和15例假阳性,logistic回归约减少3例真阳性和12例假阳性。 该结果把模型性能换算为可比较的临床取舍量,而不仅是统计指标,便于临床医生理解阈值选择带来的收益与代价。 DCA在训练与时间验证队列分别进行,并补充报告0.30阈值下的敏感度、特异度、PPV与NPV(见补充材料第7部分)。
启示与展望
该模型面向生殖医学临床医生,设计为在冻胚移植当日使用,此时包括移植日内膜厚度在内的预测变量均已常规获得,不依赖移植后信息,也不需要超出常规临床评估与数据录入的技术能力。作者强调模型用于概率风险沟通,而非排除或不利于卵巢储备低但仍有可移植胚胎的患者;当某个预测变量缺失或质量不佳时,应以临床判断为准,或推迟使用模型。研究结果适用于该中心2023年3月至2025年3月期间接受首次冻胚移植的人群,跨中心应用前需要本地重校准。
时间验证队列AUC由训练队列的0.854降至0.722,两队列在继发不孕、剖宫产史、移植胚胎数、优质胚胎数、卵巢储备减退与不良孕产史等方面存在差异,作者将其描述为时间上的病例构成漂移,并指出验证队列样本量较小,无法可靠量化这种差异对区分度下降的贡献。模型未纳入吸烟、饮酒等生活方式因素以及遗传与分子生物标志物;既往两次及以上人工流产的患者数量有限,该亚组的模型表现无法可靠评估。SHAP值反映关联而非因果,算法复杂度也可能限制临床实施,验证结果还提示可能存在过拟合。本文为快速解析版本,图表与补充材料(含变量分组标准、模型参数、阈值指标、部分依赖与ICE图)未完整呈现,因此部分细节只能依据正文描述概括。
