IBM 于 8 月 28 日发布其 Granite 系列时间序列基础模型的最新版本 Granite-TimeSeries-PatchTST-FM-r2。据模型卡介绍,该模型在 GIFT-Eval 基准测试中,针对可复现的零样本模型排名第一,超越了包括 Chronos-2Timer-S1Toto 在内的多个更大规模模型。

PatchTST-FM-r2 是 IBM 此前发布的 PatchTST-FM-r1 的延续,在架构和训练数据上均有显著升级。模型总参数量约为 3.85 亿,上下文长度达 8192,隐藏维度为 1024,patch 长度为 16,并采用覆盖 99 个分位数的分位数头。

架构上的主要变化包括:在多头自注意力层之后引入卷积层,并夹在两个“半步”前馈网络之间,形成 Conformer 块——该结构最初在语音识别领域流行。卷积子层能够捕捉 patch 之间的近期信息,从而让自注意力层专注于长期依赖关系。模型将原有的 20 个普通 Transformer 块替换为 30 个 Conformer 块,卷积核大小交替为 3 和 5,重复模式为 {5, 5, 3, 3}。此外,模型采用大小为 16、步长为 8 的重叠 patch,训练时使用 Hamming 窗损失加权,推理时采用 overlap-and-add 预测方法。为增强训练稳定性,还增加了 pre-head 层归一化。

训练数据方面,r2 在 r1 的基础上大幅扩展,包含四个来源:GiftEvalPretrain 数据集的精选子集、基于 KernelSynth 方法生成的定制合成数据(采用不同的周期核,并辅以少量增强)、基于 Chronos 论文所述流程构建的 TSMixup 数据集(但仅使用不在 GIFT-Eval 评估集中的数据),以及 CauKer 数据集——约 50 万条、每条长度 4096 的序列,由 IBM 内部生成,该方法此前也用于训练 Granite-FlowState 模型。

在性能上,除零样本可复现模型排名第一外,当将预训练模型也纳入比较时,PatchTST-FM-r2 在 CRPS 和 MASE 指标上分别位列第二和第四。值得注意的是,预训练模型被允许在预训练语料中使用 GIFT-Eval 评估数据集的训练部分,而 r2 仍能超越多个预训练模型,包括一些规模显著更大的模型。

该模型采用 OpenMDW 1.0Apache 2.0 双许可,用户可任选其一使用。IBM 已在 TSFM 仓库中提供新架构的实现,并保持与 PatchTST-FM-r1 检查点的向后兼容。

对于 AI 产业而言,这一发布的意义在于:零样本时间序列预测是许多实际应用(如需求预测、异常检测、资源规划)的关键能力,而 r2 以相对较小的参数量(不足 4 亿)超越了多个更大模型,表明架构创新与合成数据策略可以显著提升模型效率。这也为企业在选择时序基础模型时提供了更经济的选项,可能降低部署和推理成本。此外,IBM 将模型开放双许可,有助于推动该领域的进一步研究与落地。