跳到主要内容
返回时间线
arXiv来源发表:

NanoForecast v0.5 不改架构、只修训练管线,把 MASE 从 3.030 降到 1.704,并在三个 ETT 数据集上超过 200M 参数的 TimesFM

核心概要

NanoForecast v0.5 在保持 v0.3 的 6.5M 参数架构不变的前提下,修正损失作用域、张量形状对齐与增强覆盖三处训练管线问题后重训,在同一数据与算力预算下把整体 MASE 从 3.030 降到 1.704(降幅 43.8%),并在 ETTh1、ETTh2、ETTm1 与汇率四个基准上优于 200M 参数的 TimesFM,在三个 ETT 数据集上优于 15M+ 参数的 PatchTST。

AI-generated editorial illustration: NanoForecast v0.5: Competitive Time Series Forecasting Through Training Pipeline Optimization

深度剖析

论文记录了三处训练管线缺陷:数据管线无条件加入 horizon 键导致 multi_horizon=False 时点预测损失仍回传到整个上下文长度输出;多任务损失在截断到预测视野之前就计算分位数项,造成形状不匹配与分位数分支梯度流向错误维度;v0.3 只做缩放、平移与抖动增强,训练多样性偏薄。 此前工作多把精度差距归因于架构或规模,这里把三处“静默”管线错误单独列出并给出修复方式:损失项统一截断到预测视野,增强改为在循环内随机采样抖动、随机缩放、平移、掩码与时间反转。 作者用同一架构、同一语料、同一多任务损失族、同一算力预算训练 v0.3 与 v0.5 两个检查点,并在第 6.1 节固定协议下对比,属于受控的成对比较;但每个配置只发布一个检查点,未报告种子间方差。

仅修复管线、不改架构,整体 MASE 从 3.030 降至 1.704,降幅 43.8%,六个数据集全部改善;其中汇率变化最大(11.758 到 4.317),ETTh2 次之(1.328 到 1.110),ETTm1(0.288 到 0.287)与 ETTh1(0.681 到 0.676)在实际意义上接近持平。 该增益来自训练流程而非模型结构或参数量,作者据此提出一个面向领域的问题:已发表的精度差距中有多少来自训练设置而非架构。 消融表给出 v0.3 与 v0.5 在六个数据集上的逐项 MASE,作者称发布代码可复现该比较;v0.3 取第 147 轮、v0.5 取第 51 轮的验证最优快照,验证损失 0.2230 对 0.2204。

在 6.5M 参数下,v0.5 在六个基准中的四个超过 200M 参数的 TimesFM:ETTh1 0.676 对 0.705、ETTh2 1.110 对 1.360、ETTm1 0.287 对 0.545、汇率 4.317 对 4.383;并在三个 ETT 数据集上全部超过 15M+ 参数的 PatchTST(0.781、1.467、0.488)。 作者把这一结果表述为“规模并非在所有场景都取胜”,并给出效率比指标:v0.5 相对 TimesFM 的参数效率高出约 26 倍,相对 PatchTST 高出约 2 倍。 所有数字在同一协议下产生:相同切分、相同窗口、相同 MASE 分母;PatchTST 用官方代码与超参数按数据集训练,TimesFM 使用公开的 200M 检查点。作者同时说明 Chronos-T5-large 与 Timer 因在本机硬件上推理不可行而未纳入表格,只作定性讨论。

部署路径完整:训练在单张 NVIDIA T4(Google Colab)上约 12 小时(v0.3 为 11.7 小时,v0.5 为 12.2 小时),推理无需 GPU,Apple M4 CPU 上 PyTorch FP32 全量推理 19.5 ms、ONNX Runtime FP32 10.7 ms、ONNX Runtime INT8 33.3 ms,流式单步更新 19.1 ms;导出体积为 FP32 27.9 MB、INT8 9.2 MB,并提供 Docker 与有状态流式推理。 DeltaNet 层的矩阵状态跨 predict() 调用保留,使流式更新只需一次前向,而不必像窗口式方法那样为每个新预测重处理完整上下文。 延迟数字来自论文表 3 的实测,硬件为 Apple M4 CPU;代码、预训练检查点与评测框架以 Apache 2.0 发布。

启示与展望

该结果面向需要在消费级硬件上训练、在 CPU 或边缘设备上推理的预测场景,例如边缘盒子、实时分析与嵌入式板卡;作者称在体积、成本与可部署性优先时,一个训练得当的小模型可以替代 200M 参数的服务器模型。适用设定是单变量预测、512 步上下文、预测视野 96,且评测限于六个公开数据集。作者提出的下一步包括:用同一修正管线扩大共享主干(更多通道、更长上下文)以在 20M 参数以内缩小高基数数据集差距;在相同协议下补充 Chronos-T5-large、Moirai、Lag-Llama 等基线;对其他预测视野做微调并在漂移下评测流式模式;在树莓派 4 级设备与微控制器上实测导出的 ONNX 模型以量化流式部署边界。

分位数校准是仍需留意的开放问题:在同一协议下 v0.5 的区间偏窄,名义 80% 的 p10–p90 带只覆盖 51.3% 的留出值,而 v0.3 覆盖 90.3%,作者因此建议把 v0.5 的分位数读作相对不确定性而非校准概率,并把重校准或保形后处理留作未来工作,同时说明点预测不受影响。其他待观察之处包括:整体 MASE 1.704 仍落后于所测大模型(TimesFM 1.447、PatchTST 1.554);在电力(2.029 对 0.923)与交通(1.805 对 0.765)两个高基数数据集上明显落后;512 步固定上下文可能限制超长程依赖;模型按通道独立处理,不建模跨通道依赖;评测仅覆盖六个公开数据集,金融、医疗、气候等其他领域结果可能不同;每个配置只发布一个检查点,未报告种子间方差。此外,本次载入的文本在数据集列表与部署管线小节存在条目缺失,若这些缺失条目包含额外数据集或部署细节,则相关结论的覆盖范围仍需以原文为准。

来源