布达佩斯M4地铁需求预测中XGBoost精度超过NeuralProphet,且SHAP解释与专家认知一致
核心概要
该研究用布达佩斯M4地铁2024年一年、实际可用216天、5:00至24:00的小时级进站客流数据,在限定单站单方向(Kálvin tér至Kelenföld vasútállomás)和6小时预测窗口下,公平比较了内在可解释的NeuralProphet与用SHAP做事后解释的黑箱XGBoost,结果显示XGBoost预测更准(MAE 91.0753对230.2803,RMSE 144.7094对363.2115,R² 0.9600对0.7896),且SHAP给出的时间特征重要性与NeuralProphet的季节性分量及交通领域专家知识相符。
Fig. 1. Route and stations map of the metro line M4 in the city of Budapest.
· 第 2 页深度剖析
在真实公共交通需求预测任务上,黑箱XGBoost的预测精度明显高于内在可解释的NeuralProphet。 此前两类方法在交通时间序列中各自被证明有效,但它们在透明需求预测中的相对可用性尚不清楚;本文在同一数据集、同一预测窗口和同一评估流程下做了受控比较。 基于M4地铁小时级客流数据,在未参与训练的测试子集上报告MAE、RMSE与R²,指标在6小时预测窗口上取平均,并配有单周连续测试窗口的定性对比。
SHAP对XGBoost的事后解释在小时特征上复现了工作日早高峰约08:00、午后更强高峰约16:00–17:00以及周末更平缓的分布,与数据整体平均客流和NeuralProphet的季节性分量方向一致。 把事后解释的可用性从抽象主张落到可与专家认知对照的具体时间模式上,并指出小时特征在XGBoost中量级最大、是主导特征。 以数据集整体平均客流作为专家知识的对照基准,比较SHAP值与NeuralProphet季节性分量;作者说明三行代表不同量纲的量,仍观察到三者常相互吻合。
XGBoost会随一天推进把依赖从日历特征转向近期观测的滞后客流,而NeuralProphet不体现同样的滞后驱动行为。 给出了黑箱模型内部机制的一个可解释线索:夜间滞后值为零时模型更依赖小时本身,到10:00后滞后输入已可解释部分变化,从而降低当前小时的边际贡献。 来自SHAP值随小时变化的模式分析,并结合数据中夜间滞后客流为零这一事实进行解释。
研究据此主张在公共交通需求预测中优先考虑预测性能,并认为准确模型可通过SHAP获得可行的解释。 把可解释性与精度的取舍问题转化为一个可操作的选型建议,同时指出模型驱动方法在解释细腻度、专家调参和稳健性上的优势,提出混合路线。 结论建立在单一线路、单站单方向的实证比较之上,作者也将其表述为基于本研究的建议,并指出NeuralProphet与经典Prophet差异不大,deep unfolding或variable projection等模型驱动技术可能进一步缩小差距。
启示与展望
这项工作面向需要在精度与透明度之间做取舍的交通规划者与运营方,适用于具有强日周期和季节性的短时小时级客流预测场景,尤其是像M4这样以通勤为主、夜间停运的线路。它给出的可操作结论是:在类似数据条件下可以优先选择精度更高的XGBoost,并用SHAP向利益相关方解释其决策;同时提示模型驱动方法在解释细腻度、专家调参和稳健性上仍有价值,混合路线值得继续探索。作者也把结论外推到微出行、交通量预测、需求响应式公交以及电力负荷预测和环境监测等强季节性场景。
数据来自地下蜂窝天线的算法估算,本身易出错并导致缺失,最终仅216天、5:00至24:00可用,这可能影响结论在其他数据质量条件下的稳定性。分析限定在单站单方向,作者以控制空间异质性为由做了这一简化,因此跨站点、跨方向的推广仍需验证。评估以数据集整体平均客流作为专家知识的对照基准,而非独立的专家标注流程。此外,本次可获取的文本为不完整版本,图1至图3的具体数值与图形细节无法核对,因此对解释性对比的量化程度只能依据正文描述判断。
