模糊排序特征选择加H2O AutoML集成,在两个公开宫颈癌数据集上取得最高95.1%准确率与98.1% AUC
核心概要
该工作提出可解释的 Fuzzy Rank-H2O AutoML 框架,用模糊排序特征选择(FRFS)综合统计显著性、信息增益、临床重要性与不确定性挑选预测因子,再由 H2O AutoML 自动构建集成模型,并用 SHAP 与 LIME 提供全局与患者级解释;在两个公开宫颈癌数据集上以分层五折交叉验证评估,每折仅对训练集施加 SMOTE 以避免信息泄漏,报告的最高准确率为 95.1%、AUC 为 98.1%,优于传统机器学习模型与基线 H2O AutoML 框架。
深度剖析
提出 Fuzzy Rank Feature Selection(FRFS)算法,按统计显著性、信息增益、临床重要性和不确定性四个维度评估并选出最佳预测因子集合。 相对依赖传统特征选择技术的方法,该工作把不确定性纳入特征排序依据,使特征选择同时面向统计与临床考量。 文中以算法设计描述该流程,并说明所选特征随后交由 H2O AutoML 使用;摘要未给出各维度的具体权重或消融结果。
将 FRFS 选出的特征接入 H2O AutoML 自动构建集成模型,并在两个公开宫颈癌数据集上独立评估。 相对需要人工优化的既有流程,该框架把模型构建交由 AutoML 自动完成,减少手工调参环节。 评估采用分层五折交叉验证,且每折仅对训练集应用 SMOTE 以避免信息泄漏,这一设置增强了结果的可信度。
用 SHAP 提供全局特征重要性、用 LIME 提供患者级解释,形成两个层次的可解释性。 相对缺乏可解释性的黑箱预测模型,该框架同时给出整体与个体层面的解释输出。 摘要说明使用了 SHAP 与 LIME 两种方法,但未展示具体解释结果或临床医生可读性评估。
在两个公开数据集上,该框架优于传统机器学习模型与基线 H2O AutoML 框架,最高准确率 95.1%、AUC 98.1%。 相对基线 H2O AutoML 与传统机器学习模型,加入不确定性感知特征选择与双层解释后报告了更高的性能指标。 证据来自两个公开数据集的独立实验与分层五折交叉验证;摘要未列出对比模型清单、置信区间或统计检验。
启示与展望
该框架面向宫颈癌风险预测这一具体任务,适用于拥有结构化表格特征、且希望同时获得自动建模与可解释输出的场景;其设计目标是让研究者与临床相关方在无需手工调参的前提下得到准确、稳健且可解释的预测,并借助 SHAP 的全局重要性与 LIME 的患者级解释理解模型依据。由于评估基于两个公开数据集,结果适用于与这些数据分布相近的人群与特征体系。
当前可见文本为摘要级描述,未包含图表、对比模型清单、各数据集的分项结果、FRFS 四个维度的权重设定与消融实验,也未说明 SHAP 与 LIME 解释是否经过临床人员评估。因此读者仍会关注:在两个数据集上性能是否一致、提升幅度相对基线有多大、所选特征是否具有临床可解释性,以及该流程在外部数据或其他人群上的表现。这些属于后续验证的开放问题。
