基于CRISP-DM框架的机器学习无创贫血诊断系统综述
核心概要
该综述按照PRISMA流程检索PubMed、Web of Science与Scopus(2019年1月1日至2025年3月27日),从1923条记录中纳入58项研究,并以CRISP-DM各阶段(问题理解、数据理解、数据准备、建模、评估、部署)为框架,系统梳理了机器学习用于无创贫血检测与血红蛋白估计的算法、数据来源、采集部位、光源、评价指标与部署方式,同时用PROBAST工具评估偏倚风险与适用性。
The PRISMA flowchart detailing the number of articles retrieved from each database and produced after screening and eligibility assessment.
PubMed深度剖析
该综述以CRISP-DM六阶段为统一框架,把58项纳入研究从问题理解到部署逐项拆解归类,并给出算法、数据类型与采集部位的分类体系。 既有综述多聚焦深度学习、图像数据或智能手机单一维度,本文同时纳入其他机器学习算法、其他输入数据类型与多种采集设备,并把检索窗口延伸到2025年3月。 方法学上遵循PRISMA清单,双人独立筛选(Cohen's κ = 0.94),分歧由第三位评审协商解决,检索式与纳入排除标准在文中逐条列出。
纳入研究在任务、部位与信号上高度分散:33项做血红蛋白连续值回归、22项做贫血二分类、3项两者兼做;眼睛(26项,均为图像,以结膜最多)与手指(25项,多为PPG)是最常见采集部位,手掌7项居第三。 该综述把这些分散的贡献按任务、部位、数据类型与光源波长汇总成可比对的分布,并指出光源波长在660、850、940 nm出现三个明显峰值。 结论来自对58项研究逐项提取的表格化数据(Table 2)与按部位、波长统计的分布图,属于定性综合而非定量合并。
性能指标分布差异明显:回归任务中MSE离散度最大(中位数0.655 (g/dL)²,IQR 1.343),MAE中位数0.737 g/dL(IQR 0.830),RMSE中位数0.685 g/dL(IQR 0.589);分类任务中精确率最分散(中位数97%,IQR 11.26%),敏感度中位数95.35%,准确率中位数96.49%。 该综述不仅罗列单项研究的最佳成绩,还给出跨研究的指标中位数与四分位距,使读者能判断整体性能的集中与离散程度。 基于各研究报告的最佳测试或验证集指标汇总统计,作者同时提示分析域46%的高偏倚风险可能使这些接近最优的指标被高估。
PROBAST评估显示28项研究为低偏倚风险、30项为高偏倚风险、3项不明确,高偏倚风险主要来自分析域(28项),原因包括缺少乐观度校正、结局判定与时序不清、以及每个候选预测变量的结局事件数(EPV)不足。 该综述把偏倚风险域与CRISP-DM阶段对应起来(Figure 11),使方法学问题能定位到具体的数据挖掘环节。 由两位独立评估者按PROBAST的20个信号问题、4个域(参与者、预测变量、结局、分析)逐项评定,预测变量域在所有论文中均为低偏倚风险。
启示与展望
该综述的结论适用于以无创方式估计血红蛋白或筛查贫血的机器学习研究这一范围,其证据来自2019年1月1日至2025年3月27日PubMed、Web of Science与Scopus的英文文献,纳入标准限定为自主设计并实现机器学习算法、全文可得且为英文,排除侵入性方法、动物研究、已确诊患者的监测、现成商用模型评估以及方案、病例报告、综述、会议论文与预印本。综述按CRISP-DM阶段组织证据,可用于指导算法与采集部位选型、光源与硬件设计、评价指标选择以及移动端部署思路;作者也指出,若要做定量合并(如meta分析),需要另行设计研究。
读者仍需留意:纳入研究在任务定义、人群、设备与评价指标上差异较大,跨研究的中位数与四分位距只能反映分布而不能直接比较优劣;作者指出分析域高偏倚风险主要源于缺少乐观度校正,接近最优的指标可能因在验证数据上过拟合而被高估,需独立的外部验证确认;多数研究未说明贫血的病因学分型,缺铁性贫血与慢性病贫血的鉴别尚未被充分建模;校准指标使用不足,回归输出在临床决策阈值附近宜按区间而非精确值解读;公开数据集有限(如Eyes-defy-anemia、UK Biobank),多模态公开数据集的构建与发布仍待推进;此外,本文为文本层面的综述,图表中的具体数值分布细节需结合原文图表核对。
