SCOPE 用因果学习加反向归纳对齐多决策点干预,在 SimBank 与新建 SimBPIC17 基准上稳定优于现有序列式处方过程监控方法
核心概要
该工作提出 SCOPE,一种将因果学习器(S、T、RA-learner)与基于遗憾的反向归纳相结合的处方过程监控方法,直接从观测事件日志学习跨多个决策点对齐的序列干预策略,无需构建 MDP 或做数据增强;在 SimBank 与基于 BPIC17_W 事件日志新建的半合成基准 SimBPIC17 上,SCOPE 在多数实验设置中优于 KMeans-Q 与 SEP-S 等基线,并随训练集增大和决策点增多而扩大优势。
Fig. 1. Gain on SimBank across confounding levels (δ) for different training sizes. The shaded area shows one standard error over 10 iterations. SCOPE and Sep: S-learner with XGBoost.
· 第 14 页深度剖析
SCOPE 把因果学习器嵌入反向归纳,从最后一个决策点向前递归估计每个候选干预动作对目标 KPI 的影响,从而得到跨决策点对齐的序列干预策略。 既有处方过程监控方法要么只处理单一干预场景,要么在每个决策点独立优化,要么依赖 MDP 或数据增强来训练强化学习智能体;SCOPE 直接在观测事件日志上工作,不需要过程专用模拟器或日志增强。 论文给出反向归纳的 Q 函数与价值函数定义、遗憾式价值更新公式,以及 S、T、RA 三种学习器的估计流程和 SCOPE-S 的训练与推理伪代码;方法在序贯可忽略性、SUTVA 与正值性三个标准假设下可识别。
在 SimBank 上,SCOPE 在几乎所有混淆水平与训练规模组合下都优于基线,仅在训练集 1K 且混淆水平 0.99 时例外。 此前没有方法同时具备多干预、跨决策点对齐且不需要过程近似三项属性;该实验把这三项属性拆开对照,显示对齐干预比独立优化更有效。 实验覆盖混淆水平 0.9–0.99、训练集 1K/10K/50K,每个设置用 10 个随机种子,阴影区为一个标准误;随机策略增益为 -132.597 ± 0.983,上界为 411.537。
SCOPE 的优势在不同学习器与基模型下保持一致,且随决策点数量增加而扩大。 论文在 SimBank 上比较 S、T、RA 学习器与 XGBoost、随机森林、MLP/LSTM 基模型,并在 SimBPIC17 上把决策点数从 2 变到 6,检验优势是否只对特定配置成立。 S 与 RA 学习器表现最强,T 学习器在高混淆下退化最大;XGBoost 整体最好,随机森林最差;SimBPIC17 上 SCOPE 随决策点增多优势增大,但 SCOPE 与 SEP-S 都随决策点增多而偏离上界。
论文发布基于 BPIC17_W 真实事件日志的半合成基准 SimBPIC17,可方便地改变决策点数量与混淆水平,作为序列式处方过程监控的可复用评测资源。 此前 SimBank 被认为是唯一专为处方过程监控设计的模拟器;SimBPIC17 补充了一个源自真实日志、可调决策点数的半合成设置。 SimBPIC17 对既有活动 call_incomplete_files 引入干预,KPI 为 costfiles = costtpt * tptfiles + n_calls * costcall,调用效果依赖贷款类型与既往活动平均时长,银行策略为贷款类型为 car 或 loan takeover 且平均活动时长超过 4025 单位时致电;代码、算法、模拟器与额外结果公开在 GitHub 仓库。
启示与展望
该结果面向以观测事件日志为输入、存在多个可干预决策点且 KPI 可在案例结束时度量的业务过程,例如贷款审批中的流程选择与利率设定、或是否致电客户补齐材料。适用前提是序贯可忽略性、SUTVA 与正值性成立,且干预动作对应日志中已有属性。对实践者而言,论文建议优先选择 S 或 RA 学习器搭配 XGBoost 一类基模型,T 学习器在高混淆下退化明显;当训练数据充足时 SCOPE 的收益更明显,因为反向归纳中的误差传播随数据增加而减弱。
SCOPE 假设案例之间无干扰,且序贯可忽略性在业务过程中未必总成立,论文把这两点列为常见假设并指出实验在现实混淆水平下仍能学到有效策略。方法依赖底层模型的预测精度,KPI 高度不可预测时误差会沿决策点累积,论文指出这一挑战影响所有方法。此外,SCOPE 与 SEP-S 在决策点增多时都更偏离穷举上界,前者源于跨模型误差累积,后者源于独立处理决策点。当前验证基于 SimBank 与 SimBPIC17 两个贷款场景,真实事件日志无法提供反事实真值,因此真实部署中的表现仍是开放问题;论文也把处理干扰、放松序贯可忽略性以及用端到端神经框架降低计算成本列为未来方向。
