arXiv 2026年10月6日该工作基于 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元,拟合出一个五参数统一缩放律,把容量、输入长度与预测步长联系起来,并在完全留出的 Toto 2.0 系列(约 4M–2.5B 参数)上以 1.09%(输入 2048)和 1.50%(输入 4096)的 MAPE 预测其按步长平均的容量缩放曲线;同时提出统一时序学习理论,用高斯回归与匹配历史比较、参数交换和激活干预,支持全样本模型在权重中累积规则信息、冻结时序基础模型通过激活提取并跨查询复用历史规则的解释。该工作基于 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元,拟合出一个五参数统一缩放律,把容量、输入长度与预测步长联系起来,并在完全留出的 Toto 2.0 系列(约 4M–2.5B 参数)上以 1.09%(输入 2048)和 1.50%(输入 4096)的 MAPE 预测其按步长平均的容量缩放曲线;同时提出统一时序学习理论,用高斯回归与匹配历史比较、参数交换和激活干预,支持全样本模型在权重中累积规则信息、冻结时序基础模型通过激活提取并跨查询复用历史规则的解释。统一缩放律在留出的 Toto 2.0 上以 1.09% 与 1.50% 的 MAPE 预测容量曲线,并用激活干预证明冻结时序基础模型可跨查询复用历史规则该工作基于 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元,拟合出一个五参数统一缩放律,把容量、输入长度与预测步长联系起来,并在完全留出的 Toto 2.0 系列(约 4M–2.5B 参数)上以 1.09%(输入 2048)和 1.50%(输入 4096)的 MAPE 预测其按步长平均的容量缩放曲线;同时提出统一时序学习理论,用高斯回归与匹配历史比较、参数交换和激活干预,支持全样本模型在权重中累积规则信息、冻结时序基础模型通过激活提取并跨查询复用历史规则的解释。该工作基于 21 个检查点、23 个数据集-频率任务、六个领域的 18,768 个实验单元,拟合出一个五参数统一缩放律,把容量、输入长度与预测步长联系起来,并在完全留出的 Toto 2.0 系列(约 4M–2.5B 参数)上以 1.09%(输入 2048)和 1.50%(输入 4096)的 MAPE 预测其按步长平均的容量缩放曲线;同时提出统一时序学习理论,用高斯回归与匹配历史比较、参数交换和激活干预,支持全样本模型在权重中累积规则信息、冻结时序基础模型通过激活提取并跨查询复用历史规则的解释。