跳到主要内容
返回时间线
arXiv来源发表:

统一缩放律在留出的 Toto 2.0 上以 1.09% 与 1.50% 的 MAPE 预测容量曲线,并用激活干预证明冻结时序基础模型可跨查询复用历史规则

相关研究与后续进展

核心概要

该工作基于 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元,拟合出一个五参数统一缩放律,把容量、输入长度与预测步长联系起来,并在完全留出的 Toto 2.0 系列(约 4M–2.5B 参数)上以 1.09%(输入 2048)和 1.50%(输入 4096)的 MAPE 预测其按步长平均的容量缩放曲线;同时提出统一时序学习理论,用高斯回归与匹配历史比较、参数交换和激活干预,支持全样本模型在权重中累积规则信息、冻结时序基础模型通过激活提取并跨查询复用历史规则的解释。

Source-provided article image: A Unified Scaling Law for Time Series Foundation Models
Figure 1 ·

Figure 1: The Unified Scaling Law and observed resource profiles. (a) Predicted MASE over N , L N,L at H = 48,192,720 H=48,192,720 (blue, green, orange). (b)–(d) Observed means (markers) and mean predictions (lines) over identical capacity, input-length, and horizon groups, using all 1,070 Controlled points. Resource axes are logarithmic; R R is linear in (a) and logarithmic in (b)–(d). 1k denotes 1,024 steps.

arXiv

深度剖析

提出一个五参数统一缩放律,把预训练容量、输入长度与被打分的预测步长统一在同一响应面中:容量增益随历史长度增加,上下文增益趋于饱和,步长效应表现为共同平移。 以往工作分别建立训练资源缩放、容量与回看长度的交互,或长上下文收益,但未在异构已发布检查点上给出联合描述;该工作用局部资源关系加奥卡姆剃刀构造并估计该律。 在 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元上聚合出 1,070 个受控拟合点;在 1,070 个受控点上 MAPE 为 10.13%,在 111 个不重叠 GIFT Public 点上为 12.82%。

该律在完全留出的 Toto 2.0 架构上仍具预测力:剔除全部五个 Toto 2.0 检查点后重新估计,其 150 个受控网格点 MAPE 为 11.53%,按步长平均的容量曲线 MAPE 为 1.09%(输入 2048)与 1.50%(输入 4096)。 此前缩放研究多在参与拟合的模型族内报告拟合优度;这里用留出架构检验跨异构设计的可迁移性。 留出流程在重建局部目标与重新估计五个系数前移除所有 Toto 2.0 观测;对照形式中常数预测为 17.10%、容量无关形式为 11.84%,统一律为 11.53%。

提出统一时序学习理论:全样本模型通过在权重中累积信息学习,冻结时序基础模型通过激活提取信息;匹配历史比较显示额外历史具有预测价值,参数交换显示规则信息可被保留并用于新查询。 把权重内学习与上下文内推断的区分落到预测任务上,并用受控过程把规则识别、保留与复用分开检验。 在 23 个任务上,历史从 1,024 增至 8,192 使 DLinear 的 MASE 由 1.042 降至 0.931、PatchTST 由 0.885 降至 0.833;参数交换在全部 54 个过程-架构-长度-种子条件下使预测向供体规则移动。

激活干预显示冻结模型中的历史规则信息可跨查询迁移,并可在自然长上下文预测中恢复其贡献:迁移使平均误差降低 7.51%,恢复补回擦除所造成平均误差增幅的 41.67%。 以往对时序基础模型的分析多停留在误差比较;这里用激活修补直接检验历史状态对独立查询的作用。 在 TimesFM 2.5 上,擦除提高误差而迁移与恢复在全部 18 个条件下改善误差且配对查询 95% 区间为正;匹配规则供体在三个层、三种强度的每个测试条件下都优于相反规则供体,Chronos 2 在独立确认数据上恢复使平均误差降低 6.01%。

启示与展望

该律描述的是平均资源回报,适用于所观测的容量、输入长度与步长范围:受控输入网格止于 8192,长上下文支持来自 21 个检查点接口中的九个,23 个数据集-频率任务中有 12 个在每个被打分窗口都提供至少 8192 个前置观测。拟合出的上下文饱和尺度约在 3.6k–4.6k(10M–1B 参数),超过 4096 后平均配对增益略为负值,因此该律最直接服务于在部署延迟与内存约束下选择模型规模、输入长度与步长的实践者,以及规划预训练规模与验证覆盖的模型开发者。学习理论部分针对三个平稳合成过程与冻结的 TimesFM 2.5、Chronos 2,其结论适用于规则可由历史前缀识别、且查询与历史边际分布固定的设定。

读者仍会关注若干开放问题:该律在超过 8192 的输入长度、超出所观测容量范围以及未纳入面板的领域上如何表现;上下文饱和尺度随容量移动的具体形式在更大模型上是否保持;激活干预在 TimesFM 2.5 上选定的层、token 跨度与强度是否可迁移到其他架构,因为 Chronos 2 的直接迁移整体误差几乎不变而恢复仍有效;以及合成过程结论向真实非平稳序列的推广程度。此外,原文以公式图像形式给出若干关键表达式,正文未逐项列出其符号细节,因此对局部弹性与饱和尺度的精确函数形式只能依据文字描述理解。

来源