在缩放后目标上计算损失使时间序列基础模型预训练MASE在全部24项架构-基准对比中下降,GIFT-Eval平均降低18.8%
核心概要
该工作证明:仿射缩放(如ReVIN)在计算损失前反变换会把每个序列的梯度乘以缩放分母的幂,使高尺度序列主导训练(ScaleCon);改为在缩放后目标上直接计算同质残差损失(ScaleIn)后,每个小批量梯度与完整优化轨迹对序列的任意独立正缩放不变,并在四个TSFM架构预训练中于全部24项架构-基准对比降低MASE,GIFT-Eval平均降低18.8%、M竞赛平均降低21.9%。
Figure 1: ScaleIn removes scale-driven gradient bias (Theorem 3.2 ). (a) Synthetic series scales span b ∈ { 1 , 4 , 13 , 52 } b\in\{1,4,13,52\} . (b) Under ScaleCon , MSE gradients with respect to z ^ \hat{z} scale as b 2 b^{2} , giving b = 52 b{=}52 approximately 2,700 × 2{,}700\times the gradient magnitude of b = 1 b{=}1 for equal scaled residuals. (c) ScaleIn leaves gradients unchanged by rescaling, on the same y y -axis. (d) Gradient distributions under ScaleCon (solid) and ScaleIn (hatched). (e) Growing scale induces gradient drift under ScaleCon but not ScaleIn . Lower-row curves use a 15-step moving average of | ∇ ℒ | |\nabla\mathcal{L}| .
arXiv深度剖析
反变换缩放会在梯度中引入与序列尺度成正比的隐式重要性权重,使高尺度序列主导训练。 此前已有实证工作观察到在缩放后目标上计算损失可提升精度并猜测其源于低高尺度序列的等权,本文对度数为k的同质残差损失给出该机制的正式刻画,推导出尺度相关的梯度权重。 Lemma 3.1给出ScaleCon与ScaleIn目标的梯度关系,对不可微残差处的次梯度同样成立;证明见附录B。
在缩放后目标上计算损失使每个小批量梯度及完整优化轨迹对训练序列的任意独立正缩放不变。 将损失空间这一此前少被讨论的设计选择形式化为尺度不变性条件,并给出尺度等变缩放器(标准化、min-max、稳健缩放)下的适用条件。 Theorem 3.2在固定初始化、小批量序列、优化器状态与优化器随机性下证明轨迹不变;附录B.1将其扩展到多变量与分位数预测,附录B.2讨论Chronos2的arcsinh非线性。
在TSFM预训练中采用ScaleIn在全部24项架构-基准对比中降低MASE,WQL在24项中胜出21项。 在Chronos2、Moirai-2.0、TimesFM2.5与PatchTST四个架构上,以相同数据顺序、初始化与优化设置进行配对预训练,跨M1、M3、M4、Tourism、Favorita与GIFT-Eval评估。 MASE平均降幅跨架构为10.2%至24.1%,WQL平均增益3.3%至19.1%;GIFT-Eval平均降低18.8%,M竞赛平均降低21.9%;结果在四种不同缩放统计来源下一致。
ScaleIn的收益延伸到监督式神经预测与掩码重建任务,且改动量极小。 在NHITS、NBEATS、PatchTST、TCN、LSTM五个架构上,MASE在20项匹配对比中16项降低、WQL在15项降低;MOMENT掩码重建的中位重建MASE亦下降。 监督实验在M1、M3、M4、Tourism上按频率池化训练,4个随机种子;频率级层面MASE在75项中49项降低、WQL在43项降低,效应集中于年度与季度池;MOMENT结果跨4个种子平均。
启示与展望
该结果面向在异构数据集上训练的预测流程,尤其是跨域预训练的TSFM;适用条件是缩放方法尺度等变且损失为同质残差损失,覆盖标准化、min-max与稳健缩放,以及MSE、MAE与分位数损失。多变量按通道独立缩放、分位数预测与掩码重建任务均在覆盖范围内。对实践者而言,采用方式是在缩放后目标上计算损失,使用现有上下文统计量,多数流程为一行代码改动;预测在推理与评估时仍返回原始尺度。固定加性项或尺度下限会使精确不变性变为近似,但不消除梯度中的尺度权重。
多变量场景下各序列独立缩放时尺度偏置依然存在,但其实际影响以及联合变换相关通道的更一般归一化方案尚待研究;损失空间选择与概率目标及其参数化的交互也超出本文研究的同质损失范围。监督式神经预测的收益虽广泛但幅度温和,且在不同架构与基准间存在差异,频率级结果集中于年度与季度池,经典统计基线在若干基准-指标组合上仍具竞争力。此外,原文中部分数值与表格单元格在解析后缺失,例如调查模型数量、部分百分比与若干表格条目,因此对这些具体数字的复述以可读文本为准。
