七种KNN超参数调优策略在15个数据集上的对比:PSO综合排名最优,但仅显著优于随机搜索
核心概要
该研究在嵌套交叉验证框架下,对经典KNN在由整数近邻数k、类别型距离度量和连续Minkowski指数p构成的混合搜索空间上,比较了网格搜索、随机搜索、贝叶斯优化、遗传算法、代理优化、粒子群优化(PSO)和灰狼优化器七种调优策略,在15个公开分类数据集上用准确率、宏AUC、交叉验证损失、交叉熵损失和运行时间五项指标评估,结果显示PSO取得最佳综合平均排名,但经Holm校正的Wilcoxon符号秩检验表明其仅相对随机搜索具有统计显著优势。
Creative Commons License
深度剖析
在统一的嵌套验证协议下,七种调优策略在15个数据集上的综合排名存在统计显著差异(Friedman检验 χ²_F = 22.859,p = 0.000845),PSO以综合排名3.580居首,网格搜索(3.680)和贝叶斯优化(3.760)紧随其后,随机搜索以5.033垫底。 以往研究多只比较一两种调优策略或仅关注预测性能,本研究在同一评估预算(B = 40)和同一嵌套交叉验证框架下同时比较了基于采样、基于模型和基于种群的七类优化器,并同时报告预测质量与计算成本。 基于15个公开数据集(UCI、OpenML、Kaggle)的五项指标排名,采用Friedman非参数检验和Holm校正的Wilcoxon符号秩检验,统计流程规范;但每个随机方法仅使用单一随机种子(RngSeed = 1)运行一次。
PSO的最佳综合排名主要由运行时间优势驱动(运行时间排名1.267),但其准确率排名相对较弱(4.500);贝叶斯优化取得最佳准确率平均排名(3.367),网格搜索在宏AUC(3.200)和交叉验证损失(2.633)上表现突出。 该结果揭示了不同调优策略在预测性能与计算成本之间存在权衡,而非某一方法在所有指标上全面占优,为按场景选择调优策略提供了多指标依据。 综合排名由五项指标等权平均计算,各指标方向明确(准确率和宏AUC越高越好,CV损失、CE损失和运行时间越低越好),并列值采用平均排名处理。
Holm校正后的配对Wilcoxon检验显示,PSO仅相对随机搜索具有统计显著优势(p_Holm = 0.000366,中位差Δ = −1.2),与灰狼优化器、代理优化、遗传算法、贝叶斯优化和网格搜索的差异均不显著(p_Holm ≥ 0.316)。 这一发现将Friedman检验的整体显著性细化为具体的成对比较,表明七种方法中多数两两差异在统计上难以区分,避免了对综合排名的过度解读。 基于15个数据集的配对秩差进行Wilcoxon符号秩检验,并采用Holm逐步下降法控制族错误率,多重比较校正流程完整。
研究指出heart disease数据集上所有方法均达到完美性能(准确率1、宏AUC 1、CE损失0),但该数据集版本含1025个实例中有723条重复记录,可能使KNN这类基于实例的分类器产生高估的性能估计。 作者主动标注了这一潜在的数据泄漏风险,提醒读者谨慎解读该数据集上的完美结果,体现了对基准数据质量问题的关注。 基于对数据集重复记录的检查与报告,重复记录被保留而未删除以保持原始基准数据集完整性。
启示与展望
该研究的结果适用于经典KNN分类器在由整数近邻数k∈[1,51]、类别型距离度量{euclidean, cityblock, chebychev, minkowski}和连续Minkowski指数p∈[1,5]构成的混合搜索空间上的调优场景,评估预算固定为B = 40次目标函数评估(网格搜索除外,执行182次评估)。实验在MATLAB R2022b环境下运行,采用外层80/20分层留出和内层5折分层交叉验证,标准化严格在训练折内进行以避免数据泄漏。该框架为在有限计算资源下选择调优策略提供了可复现的基准,代码已公开于GitHub。结论对中小规模表格分类数据集具有参考价值,作者建议根据数据集维度、类别结构和目标函数不规则性来选择调优策略。
该研究每个随机方法仅使用单一随机种子(RngSeed = 1)运行一次,作者在结论中明确将多种子重复实验列为未来工作,因此当前排名结果的稳定性尚待验证。综合排名采用五项指标等权平均,作者也指出未来需进行敏感性分析以考察替代权重方案的影响。网格搜索执行182次评估而其他方法仅40次,两者并非完全评估匹配,这一差异对排名的影响值得关注。此外,heart disease数据集含723条重复记录导致所有方法均达完美性能,该数据集上的结果不宜作为方法区分依据。作者还提出未来将探索多目标调优、代理模型与种群搜索的混合策略以及新型元启发式算法,这些方向目前尚未在本研究中覆盖。
