IBM Granite Time Series PatchTST-FM-r2 发布
IBM 发布了 Granite Time Series PatchTST-FM-r2,这是一个用于零样本(zero-shot)时间序列预测的通用基础模型。该模型使用户无需为每个数据集训练单独的模型,即可生成需求、价格、能源负载和遥测数据的预测。
最先进的零样本性能
截至 2026 年 9 月 8 日,在 GIFT-Eval 排行榜的可复制模型中,PatchTST-FM-r2 是在宽松且商业友好的许可协议下发布的性能最高的零样本模型。在连续排名概率评分(CRPS)和平均绝对缩放误差(MASE)方面,它在可复制的零样本模型中均排名第 2 位。
即使与“预训练”模型(即允许在其预训练语料库中包含 GIFT-Eval 训练数据的模型)相比,PatchTST-FM-r2 仍具有极强的竞争力,在 CRPS 方面排名第 3,在 MASE 方面排名第 4。它的表现优于包括 Chronos-2、Timer-S1 和 Toto 变体在内的多个更大的预训练模型。
架构增强
PatchTST-FM-r2 对其前身 PatchTST-FM-r1 的架构进行了演进,以更好地捕捉长期和短期的时间关系。
基于 Conformer 的骨干网络
该模型使用 conformer 块取代了标准的 transformer 层。这些块将多头自注意力机制与时间卷积层相结合,提供了两种互补的推理机制:
- Self-attention:建模 patch 之间的长程关系。
- Convolution:为局部时间结构提供归纳偏置,从而捕捉更短期的交互作用。
为了优化这一点,conformer 块在重复的 {5, 5, 3, 3} 模式中使用交替的卷积核大小(3 和 5)。这使得自注意力机制能够专注于长距离关系,而不是像标准 transformer 那样集中在对角线附近。
精细化的 Patching 和稳定性
为了提高预测准确性并平滑 patch 边界,该模型实现了:
- 50% 重叠的 patches,并带有 Hamming-window 加权。
- Overlap-and-add 预测。
- 增加的深度:架构已从 20 个块扩展到 30 个块。
- Normalization:为提高稳定性而添加。
模型规格与能力
PatchTST-FM-r2 是一个约 385M 参数的模型,具有以下技术能力:
- Context Length:支持高达 8,192 个步骤。
- Probabilistic Forecasting:通过专门的预测头预测 99 个分位数,提供点预测和不确定性区间。
- Flexible Forecast Lengths:支持可变长度的未来预测。
- Missing Value Support:包括对缺失值填补的支持。
训练数据与透明度
IBM 提供了一份记录在案的预训练语料库,以协助企业用户进行治理和许可审查。训练数据由四个主要来源组成:
- 来自 GiftEvalPretrain 的精选数据集。
- 基于 KernelSynth 的自定义合成数据,具有修改后的周期性内核和有限的增强。
- 一个 TSMixup 语料库(仅限于 GIFT-Eval 评估集之外的数据集)。
- 约 500,000 个长度为 4,096 的合成 CauKer 序列。
许可与可用性
Granite Time Series PatchTST-FM-r2 采用 Apache 2.0 和 OpenMDW 1.0 双重许可,允许用户根据其需求选择最合适的许可。两种许可都提供了使用、修改和分发该模型的宽松权利。
模型权重、架构、推理流水线以及重现基准测试结果所需的代码,均可通过 Hugging Face Hub 和 granite-tsfm GitHub 仓库获取。该实现与 PatchTST-FM-r1 checkpoint 保持向后兼容。
生产环境集成
除了独立使用外,IBM 和 Confluent 还将 Granite Time Series 模型集成到了 Confluent Cloud 的早期访问计划中。这允许直接在 Apache Flink 流式应用中使用基础模型推理,从而在无需将数据移动到单独的 ML 环境的情况下,实现实时预测和异常检测,处理实时数据流。