用Google搜索数据加机器学习预测澳大利亚各州流感周报数,最佳模型相关系数从-0.353到0.977
核心概要
该研究用2018至2019年Google Trends周搜索量与澳大利亚国家法定传染病监测系统(NNDSS)的流感周报数对比,为除首都领地外的各州和领地分别训练弹性网、支持向量回归、随机森林和前馈神经网络四种监督回归模型,做当周(nowcast)及提前一至两周的预测,发现搜索量与流感报告率随时间相关,随机森林与弹性网总体表现较好,除北领地和塔斯马尼亚外每个建模辖区都至少有两个搜索词与流感通报呈中度至强Pearson相关,最佳模型预测准确度(Pearson相关系数)因辖区而异(-0.353至0.977),且提前一至两周的准确度更低,人口较少的辖区准确度也更低。
深度剖析
研究检验了用Google Trends搜索数据在澳大利亚州和领地层面预测流感率的可行性,发现搜索量与流感通报随时间存在相关性。 此前基于搜索数据的流感预测研究多在国家层面或单一城市开展,该工作把分析单元下沉到澳大利亚各州和领地,并逐一独立建模。 基于2018至2019年Google Trends周搜索量与NNDSS周流感通报的对比,除首都领地外各州和领地均纳入分析。
在四种监督回归模型中,随机森林与弹性网总体预测表现优于支持向量回归和前馈神经网络。 该研究在同一数据与同一预测任务下并列比较了四类模型,而非只报告单一模型的结果。 四种模型分别为弹性网、支持向量回归、随机森林和前馈神经网络,按州和领地独立拟合,并区分当周与提前一至两周的预测。
预测表现存在明显地域差异:除北领地和塔斯马尼亚外,每个建模辖区都至少有两个搜索词与流感通报呈中度至强Pearson相关;最佳模型准确度从-0.353到0.977不等。 该结果把搜索数据预测效用的强弱与具体辖区绑定,指出人口较少的辖区准确度更低。 准确度以Pearson相关系数衡量,按辖区报告,并显示提前一至两周的预测准确度低于当周预测。
启示与展望
该研究面向澳大利亚各州和领地的公共卫生监测场景,适用于以周为单位的流感率当周估计与提前一至两周预测;数据窗口为2018至2019年,首都领地未纳入建模。作者提出后续工作应研究按地点划分的具体关键词,在更细的地理层级上探索疾病预测,并考虑人口较少的情形以及随时间推移的稳健性。
读者仍会关注:具体哪些搜索词在各辖区入选、模型如何调参与验证、以及2018至2019年之外的季节是否保持同样的预测表现;作者也把人口较少辖区的准确度与随时间稳健性列为待解问题。由于本次读取范围不完整,缺少图表与结果表,无法进一步核对分辖区的逐项数值。
