在14个事件日志上,剩余时间预测的误差与不确定性随延迟增大而上升,用不确定性特征做延迟检测把平均召回率从0.21提到0.61
核心概要
该研究在14个公开事件日志上分析业务流程延迟检测的内在难度,发现剩余时间分布强烈右偏、现有LSTM模型能拟合分布众数但在高延迟案例上表现很差,且预测误差与预测区间宽度随真实剩余时间增大而增大(14个日志中10个呈正相关),据此评估不平衡回归方法(SMOGN重采样、CSW、BMSE、EAL、SERA)仅带来有限收益,转而用生存分析模型输出的不确定性特征(预测标准差、80%与90%预测区间宽度、尾部质量等)配合CatBoost做延迟二分类,在q=0.8阈值下把平均召回率从0.21提升到0.61且精确率无显著下降。
深度剖析
研究刻画了延迟检测的难度来源:剩余时间分布强烈右偏,模型能捕捉众数却无法预测高延迟案例,且预测不确定性随剩余时间增大而增大。 以往工作多用MAE等聚合指标评估剩余时间预测,掩盖了模型在目标分布不同区段的表现差异;该工作按many/medium/few区段分解误差,并系统报告了异方差性。 在14个公开事件日志上分析,报告了Fisher偏度系数(如BPIC20DD为11.5、BPIC20RFP为10.6、BPIC15-3为10.0,Helpdesk为-0.1),并计算真实剩余时间与绝对误差、生存模型预测区间宽度的Spearman相关(14个日志中10个两者均为正相关,BPIC20ID达0.64与0.80,但BPIC15-2与Helpdesk为负相关)。
针对目标不平衡的数据层与算法层方法对长尾预测帮助有限,说明尾部数据稀缺可能不是主要瓶颈。 此前不平衡回归方法(SMOGN、CSW、BMSE、EAL、SERA)主要验证于分类或视觉/时序任务,该工作首次在PPM的剩余时间回归上系统比较,并针对左填充前缀序列改造了SMOGN的邻域选择。 SMOGN在14个日志上使few区nMAE降低8.0%,但medium与many区分别上升20.5%与31.4%,整体nMAE上升17.5%;算法层方法中SERA在few区排名最好(1.00)并显著优于Vanilla、CSW、EAL,但整体显著更差,EAL与CSW整体排名最好;Friedman检验p<0.001,配对比较用Wilcoxon符号秩检验。
把生存分析模型给出的不确定性估计作为特征输入下游分类器,可大幅提升高延迟案例的识别能力。 以往不确定性感知的剩余时间预测工作只关注量化不确定性本身,未研究偏斜目标分布与不确定性的交互,也未把不确定性用于延迟检测这一决策任务。 在14个日志、q=0.8阈值、五个随机种子的设置下,平均召回率从0.21升至0.61,平均F1从0.21升至0.44,平均PR-AUC从0.23升至0.33,精确率平均从0.38变为0.42且整体无显著差异(p=0.17);召回率、F1、PR-AUC的提升分别对应p<0.0001、p<0.0001、p<0.0003;BPIC20PTC上基线仅识别175个高延迟案例中的1个,不确定性感知模型识别132个;在q=0.9的更严格定义下结果类似。
不确定性感知模型在案例执行早期即可更可靠地识别延迟案例。 该工作把前缀长度按完整轨迹事件数归一化,按执行进度分组评估,从而刻画延迟检测在时间维度上的可用性,而不仅是最终分类性能。 在对应执行进度20%、40%、60%、80%的前缀子集上,不确定性感知模型在全部前缀比例下均优于基线,早期阶段增益最明显,召回率显著更高而精确率相当,F1与PR-AUC一致改善。
启示与展望
该结果面向使用事件日志做预测性流程监控的组织,适用于以剩余时间回归为基础、需要提前识别高延迟案例的场景;方法上以数据感知LSTM编码器加生存分析头为骨架,延迟检测被表述为基于分位数阈值(如q=0.8,另在q=0.9下验证)的二分类任务,不确定性特征包括预测标准差、80%与90%预测区间宽度、尾部质量以及已用时间等时间上下文特征,下游使用CatBoost分类器。作者指出,延迟检测把回归问题抽象为阈值分类,因此这些提升不应被理解为剩余时间估计本身的改进;后续可探索更丰富的不确定性建模、引入更多上下文信息,以及在变化流程环境中在线适配延迟检测方法。
异方差的方向与强度在不同流程间并不一致:BPIC15-2与Helpdesk在两个指标上均为负相关,BPIC17W与BPIC15-4表现混合,因此不确定性作为延迟信号的有效性可能依赖具体流程。不确定性本身的来源尚未完全拆解,可能来自流程波动、上下文缺失或概念漂移。延迟检测依赖阈值选择并损失信息,作者建议未来直接建模剩余时间的完整条件分布,把延迟检测与服务级别违约等问题表述为下游决策规则。此外,评估基于公开事件日志与LSTM类模型,向其他领域、工业环境与其他架构的推广程度仍待检验。
