stumpy-dev/stumpy

STUMPY is a powerful and scalable Python library for modern time series analysis

解決的問題

STUMPY 是為了解決在時間序列資料中高效尋找最近鄰子序列的問題而設計的。它讓使用者能在不需事先了解模式形狀的情況下,自動識別長時間序列中最具相似性的模式(動機)或最不相似的模式(離群點/異常)。

工作原理

該函式庫計算「矩陣輪廓」(matrix profile),這是一種資料結構,儲存時間序列中每個子序列與其最近鄰之間的距離。STUMPY 提供多種實作方式,以應對不同規模的資料:

  • 標準 CPU 執行:使用 stumpy.stump 進行單伺服器處理。
  • 分散式執行:透過 Dask Distributed 使用 stumpy.stumped 處理大型資料集。
  • GPU 加速:使用 stumpy.gpu_stump 實現高效能運算。
  • 多維度支援:使用 stumpy.mstump 同時分析多個時間序列維度。

適用對象

STUMPY 適用於需要執行時間序列資料探勘任務(如動機發現、異常偵測與語意分割)的學術研究人員、資料科學家與軟體開發人員。

主要亮點

  • 可擴展性:透過 Dask 支援 CPU、GPU 與分散式運算。
  • 多功能性:能處理一維與多維時間序列。
  • 完整的工具集:包含時間序列鏈(ATSC)與語意分割(FLUSS)的專用函式。
  • 高效率:利用 Numba JIT 編譯實現高效執行。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案