IBM Granite Time Series PatchTST-FM-r2 發佈
IBM 已發佈 Granite Time Series PatchTST-FM-r2,這是一款用於零樣本(zero-shot)時間序列預測的通用基礎模型。此模型讓使用者無需為每個數據集訓練獨立模型,即可生成需求、價格、能源負載和遙測數據的預測。
尖端零樣本性能
截至 2026 年 9 月 8 日,在 GIFT-Eval 排行榜的可複製模型中,PatchTST-FM-r2 是在寬鬆且對商業友好的授權下發佈的性能最強的零樣本模型。在連續排名機率分數(CRPS)和平均絕對縮放誤差(MASE)方面,它在可複製的零樣本模型中均排名第 2 位。
即使與「預訓練」模型(即允許在其預訓練語料庫中包含 GIFT-Eval 訓練數據的模型)相比,PatchTST-FM-r2 仍具備高度競爭力,在 CRPS 方面排名第 3,在 MASE 方面排名第 4。它的表現優於多個較大的預訓練模型,包括 Chronos-2、Timer-S1 和 Toto 變體。
架構增強
PatchTST-FM-r2 進化了其前身 PatchTST-FM-r1 的架構,以更好地捕捉長期和短期時間關係。
基於 Conformer 的骨幹網路
該模型將標準 Transformer 層替換為 Conformer 區塊。這些區塊結合了多頭自注意力機制與時間卷積層,提供了兩種互補的推理機制:
- Self-attention:建模區塊(patches)之間的長程關係。
- Convolution:提供對局部時間結構的歸納偏置,捕捉較短期的交互作用。
為了優化這一點,Conformer 區塊使用交替的 3 和 5 的卷積核大小,遵循重複的 {5, 5, 3, 3} 模式。這使得自注意力機制能夠專注於長距離關係,而不是像標準 Transformer 那樣集中在對角線附近。
精細化的分塊與穩定性
為了提高預測準確度並平滑分塊邊界,該模型實施了:
- 使用 Hamming-window 加權的 50% 重疊分塊。
- Overlap-and-add 預測。
- 增加深度:架構已從 20 個區塊擴展到 30 個區塊。
- Normalization:為了提高穩定性而添加。
模型規格與能力
PatchTST-FM-r2 是一個約 385M 參數的模型,具有以下技術能力:
- Context Length:支援高達 8,192 個步驟。
- Probabilistic Forecasting:透過專門的預測頭預測 99 個分位數,提供點預測和不確定性區間。
- Flexible Forecast Lengths:支援變動長度的未來預測。
- Missing Value Support:包含對缺失值填補的支持。
訓練數據與透明度
IBM 提供了一份文件化的預訓練語料庫,以協助企業用戶進行治理和授權審查。訓練數據由四個主要來源組成:
- 選自 GiftEvalPretrain 的數據集。
- 基於 KernelSynth 的自定義合成數據,具有修改過的週期性核函數和有限的增強。
- 一個 TSMixup 語料庫(僅限於 GIFT-Eval 評估集之外的數據集)。
- 約 500,000 個長度為 4,096 的合成 CauKer 序列。
授權與可用性
Granite Time Series PatchTST-FM-r2 採用 Apache 2.0 和 OpenMDW 1.0 雙重授權,允許使用者選擇最符合其需求的授權方式。兩種授權均提供使用、修改和分發模型的寬鬆權利。
模型權重、架構、推理流水線以及重現基準測試結果所需的代碼,均可透過 Hugging Face Hub 和 granite-tsfm GitHub 儲存庫取得。該實作與 PatchTST-FM-r1 檢查點具有向後相容性。
生產環境整合
除了獨立使用外,IBM 與 Confluent 也已將 Granite Time Series 模型整合到 Confluent Cloud 的早期存取計畫中。這允許直接在串流應用程式中使用 Apache Flink 進行基礎模型推理,從而實現對即時數據流的即時預測和異常檢測,而無需將數據移動到單獨的 ML 環境中。