IBM 於 8 月 28 日釋出其 Granite 系列時間序列基礎模型的最新版本 Granite-TimeSeries-PatchTST-FM-r2。據模型卡介紹,該模型在 GIFT-Eval 基準測試中,針對可復現的零樣本模型排名第一,超越了包括 Chronos-2、Timer-S1 和 Toto 在內的多個更大規模模型。
PatchTST-FM-r2 是 IBM 此前釋出的 PatchTST-FM-r1 的延續,在架構和訓練資料上均有顯著升級。模型總引數量約為 3.85 億,上下文長度達 8192,隱藏維度為 1024,patch 長度為 16,並採用覆蓋 99 個分位數的分位數頭。
架構上的主要變化包括:在多頭自注意力層之後引入卷積層,並夾在兩個“半步”前饋網路之間,形成 Conformer 塊——該結構最初在語音識別領域流行。卷積子層能夠捕捉 patch 之間的近期資訊,從而讓自注意力層專注於長期依賴關係。模型將原有的 20 個普通 Transformer 塊替換為 30 個 Conformer 塊,卷積核大小交替為 3 和 5,重複模式為 {5, 5, 3, 3}。此外,模型採用大小為 16、步長為 8 的重疊 patch,訓練時使用 Hamming 窗損失加權,推理時採用 overlap-and-add 預測方法。為增強訓練穩定性,還增加了 pre-head 層歸一化。
訓練資料方面,r2 在 r1 的基礎上大幅擴充套件,包含四個來源:GiftEvalPretrain 資料集的精選子集、基於 KernelSynth 方法生成的定製合成數據(採用不同的週期核,並輔以少量增強)、基於 Chronos 論文所述流程構建的 TSMixup 資料集(但僅使用不在 GIFT-Eval 評估集中的資料),以及 CauKer 資料集——約 50 萬條、每條長度 4096 的序列,由 IBM 內部生成,該方法此前也用於訓練 Granite-FlowState 模型。
在效能上,除零樣本可復現模型排名第一外,當將預訓練模型也納入比較時,PatchTST-FM-r2 在 CRPS 和 MASE 指標上分別位列第二和第四。值得注意的是,預訓練模型被允許在預訓練語料中使用 GIFT-Eval 評估資料集的訓練部分,而 r2 仍能超越多個預訓練模型,包括一些規模顯著更大的模型。
該模型採用 OpenMDW 1.0 與 Apache 2.0 雙許可,使用者可任選其一使用。IBM 已在 TSFM 倉庫中提供新架構的實現,並保持與 PatchTST-FM-r1 檢查點的向後相容。
對於 AI 產業而言,這一發布的意義在於:零樣本時間序列預測是許多實際應用(如需求預測、異常檢測、資源規劃)的關鍵能力,而 r2 以相對較小的引數量(不足 4 億)超越了多個更大模型,表明架構創新與合成數據策略可以顯著提升模型效率。這也為企業在選擇時序基礎模型時提供了更經濟的選項,可能降低部署和推理成本。此外,IBM 將模型開放雙許可,有助於推動該領域的進一步研究與落地。