stumpy-dev/stumpy

STUMPY is a powerful and scalable Python library for modern time series analysis

解决的问题

STUMPY 旨在高效地在时间序列数据中找到最近邻子序列。它允许用户在无需预先了解模式形状的情况下,自动识别长时序数据中最相似的模式(动机)或最不相似的模式(离群点/异常)。

工作原理

该库计算一个「矩阵轮廓」(matrix profile),这是一种数据结构,存储时间序列中每个子序列与其最近邻之间的距离。STUMPY 提供了多种实现方式,以应对不同规模的数据:

  • 标准 CPU 执行:使用 stumpy.stump 进行单服务器处理。
  • 分布式执行:通过 Dask Distributed 使用 stumpy.stumped 处理大规模数据集。
  • GPU 加速:使用 stumpy.gpu_stump 实现高性能计算。
  • 多维支持:使用 stumpy.mstump 同时分析多个时间序列维度。

适用人群

STUMPY 适用于需要执行时间序列数据挖掘任务(如动机发现、异常检测和语义分割)的学术研究人员、数据科学家和软件开发人员。

主要亮点

  • 可扩展性:通过 Dask 支持 CPU、GPU 和分布式计算。
  • 多功能性:能够处理一维和多维时间序列。
  • 全面的工具集:包含时间序列链(ATSC)和语义分割(FLUSS)的专用函数。
  • 高性能:利用 Numba JIT 编译实现高效执行。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目