PyroAdapt 用检索加排序微调把加州野火每日预警的平均精度从 21.62% 提到 24.35–24.57%,固定 34 格预算下多捕获 344 个正样本格日
核心概要
该工作提出 PyroAdapt 的“预训练—检索—排序”框架:先用历史数据预训练野火风险模型,再用目标年份的无标签协变量检索相似历史位置,并通过同一天火—非火格点对的排序损失(直接排序、残差成对 DPO、选择性排序)进行微调;在加州 666 个 0.25° 格点上,三种排序目标把日均平均精度从继续焦点微调的 21.62% 提升到 24.35–24.57%,Top5% 召回从 18.70% 提升到 22.11–22.79%,在每日 34 格(5% 面积)的固定检测预算下选择性排序多捕获 344 个正样本格日,并在 Yosemite 的滚动评估中显示排序收益在时间分布漂移下仍然存在。
深度剖析
PyroAdapt 把野火发生预测重构为“预训练—检索—排序”的批量直推式适配流程:历史焦点预训练给出风险表示,目标年份的无标签协变量用于检索相似历史样本,检索到的历史标签再构成正—负对用于排序微调,全程不使用目标年份标签。 与只做源域训练或继续焦点微调的做法相比,这里把适配拆成表示学习、目标条件样本选择与决策对齐三步,并明确检索只做样本选择、不做标签传播。 论文给出完整流程与公式,并在 Yosemite(9 格、2021 年 3,285 个目标格日、363 个正样本)与加州(666 格、2022 年 351 个火日、14,760 个正样本)两套设置上执行;加州检索查询全部 243,090 个无标签目标协变量,得到 363,643 条唯一历史样本。
论文用统一的分数差公式比较直接排序、残差成对 DPO(RDPO)与选择性排序,说明三者如何把梯度分配到“预训练已排对”和“预训练排错”的两类样本对上,并给出非负目标下每日预算内可避免漏报的有限样本界。 此前 DPO 类目标多用于语言模型偏好优化,这里把它与成对排序、成本敏感分类联系起来,并推导出二值标签 RDPO 的归约与条件最优解。 命题 1、2、5、6 给出梯度分配、目标敏感度上界与预算证书,附录 A 给出证明;论文同时说明这些是软目标,任务层面的纠正与保持仍需实证评估。
在加州全域,三种排序目标在无焦点监督下都优于继续焦点微调:日均平均精度 24.35%/24.47%/24.57% 对 21.62%,Top5% 召回 22.25%/22.11%/22.79% 对 18.70%;在每日 34 格的固定预算下,选择性排序平均捕获 3,210.3 个正样本格日,比继续焦点的 2,866.0 多 344 个。 相对此前把野火预测当作逐点分类或全局排序的做法,这里把训练对限定在同一天内,使排序目标直接对齐“每天在有限监测预算下优先看哪些格点”的决策。 结果基于三个模型种子(11、22、33)在完整 666 格每日网格上的评估,报告均值与标准差;论文同时指出这些是邻域平滑后的正样本格日,不是独立起火事件。
在按干物质消耗划分的高强度火情分层中,选择性排序在最高 5%/10%/20% 干物质层把召回分别提高 39.70/28.18/20.50 个百分点;Yosemite 的滚动评估显示排序带来的收益在时间分布漂移下持续存在。 这把评估从整体排序扩展到对高活动强度事件的敏感性,并在跨年份滚动设置中检验适配是否随年份变化而失效。 加州分层基于 2,193 个原始干物质为正的测试样本,按各策略历史 F1 阈值计算召回;Yosemite 滚动覆盖 2019–2021 三个测试年、九个“年份—种子”组合,直接排序滚动 AUROC 74.19%、AUPRC 24.30%,高于预训练模型的 73.12% 与 22.85%。
启示与展望
这项工作面向的是“在固定每日监测预算下优先排序哪些格点”的决策场景:加州实验覆盖 666 个 0.25° 格点、2022 年一个目标年份,且只针对历史上出现过的位置;Yosemite 实验在固定 9 格上做跨年份滚动检验。它适合作为历史预训练风险模型的下游适配层,供需要在每日有限告警数内排序候选位置的研究与业务团队参考,并可与区域分层审计、按区域报告性能的部署流程配合。论文还给出面向更大范围部署的未测试设计,包括区域残差部分池化、支持度感知的检索距离、区域内/跨区域偏好混合与稀疏区域校准收缩。
加州评估只覆盖一个目标年份,且适配阶段使用了整个目标年的协变量,属于批量直推式设定;论文明确指出按发布时刻只用当时可得协变量的在线适配尚未评估。三个排序目标共用同一停止规则但实际更新轮数不同,因此目标之间的小幅差异不宜单独归因于损失形式。高强度干物质分层是回顾性划分,各策略使用各自的历史 F1 阈值,告警率并未对齐,因此该诊断说明的是对高观测活动强度的敏感性,而不是严重程度预测或等预算下的严重事件区分能力。检索的有效性依赖历史与目标协变量存在有用重叠,论文也说明当目标情形在历史档案中缺失时检索无法重建。标签是邻域平滑后的发生指示,不是经核实的起火点,正样本格日也可能来自同一场火,不应读作独立事件计数。此外,本次加载的是论文全文,但首页证据包中的社区讨论与引用条目为空,若读者关心外部复现或后续引用情况,这部分仍需另行查证。
