PatchTST の Hugging Face への統合
Hugging Face は、長期時系列予測向けに設計された Transformer ベースのモデルである PatchTST を統合しました。時系列をサブシリーズレベルのパッチに分割し、チャネル独立アーキテクチャを採用することで、PatchTST は計算コストを削減しつつローカルな意味情報を保持し、モデルの履歴コンテキストウィンドウを拡張します。
PatchTST のアーキテクチャと主要メカニズム
PatchTST は、時系列予測における従来の Transformer の適用を、以下の 2 つの主要な技術要素によって改善します。
時系列パッチング
個々の時点をトークンとして扱う代わりに、PatchTST は時系列を一定サイズのパッチにベクトル化します。この設計は、次の 3 つの具体的な利点を提供します。
- ローカル意味の保持: ローカルパターンが埋め込み内で保持されます。
- 計算効率: パッチ間のストライドを使用することで、アテンションマップのメモリと計算要件がルックバックウィンドウに対して二乗的に削減されます。
- 拡張コンテキスト: パッチ長(ベクトルサイズ)とコンテキスト長(シーケンス数)のバランスを取ることで、モデルはより長い履歴シーケンスに注意を向けることができます。
チャネル独立性
PatchTST は各チャネルを単一の単変量時系列として扱います。すべての単変量系列は同じ埋め込みと Transformer 重みを共有し、実質的にグローバルな単変量モデルとして機能します。
モデルの能力とトレーニング戦略
PatchTST は、教師あり予測と自己教師ありマスク時系列事前学習の両方をサポートするモジュラー設計を備えています。
直接予測
教師あり設定では、モデルはパッチベクトルを使用して特定の予測長さの予測を出力します。Electricity データセットで訓練した場合、モデルは平均二乗誤差 (MSE) 0.131 を達成し、元論文で報告された結果と一致しました。
転移学習とゼロショット性能
PatchTST は強力な転移学習能力を示し、あるソースドメインで事前学習したモデルをターゲットドメインに適用できます。Electricity データセットから ETTh1 データセットへの転移テストでは、以下の性能層が観測されました。
- ゼロショット予測: 追加の学習なしで事前学習モデルをターゲットドメインで評価した結果、MSE は 0.370 となりました。
- 線形プロービング: 冻結された事前学習バックボーン上に線形層のみを訓練することで、MSE が 0.357 に低減しました。
- フルファインチューニング: ターゲットデータでモデル全体を微調整した結果、MSE は 0.354 となりました。
実装と統合
PatchTST は Hugging Face の Transformers ライブラリで利用可能です。データ前処理には IBM の tsfm パッケージが使用されています。
PatchTSTConfig の主な設定パラメータは以下です。
context_length: 入力として使用される履歴データの量。patch_length: コンテキストウィンドウから抽出されるパッチの長さ。patch_stride: パッチ抽出時に使用されるストライド。d_model: Transformer 層の次元。num_attention_heads: 各層のアテンションヘッド数。