stumpy-dev/stumpy

STUMPY is a powerful and scalable Python library for modern time series analysis

해결하는 문제

STUMPY는 시간 시리즈 데이터 내에서 근접한 부분 시계열을 효율적으로 찾는 문제를 해결하도록 설계되었습니다. 사용자는 패턴의 형태에 대해 사전 지식 없이도 긴 시간 시리즈 내에서 가장 유사한 패턴(모티프) 또는 가장 비슷하지 않은 패턴(디스코드/이상치)을 자동으로 식별할 수 있습니다.

작동 방식

이 라이브러리는 "매트릭스 프로파일"이라는 데이터 구조를 계산합니다. 이는 시간 시리즈 내의 모든 부분 시계열이 가장 가까운 이웃과의 거리를 저장하는 구조입니다. STUMPY는 다양한 규모의 데이터를 처리하기 위해 여러 구현을 제공합니다:

  • 표준 CPU 실행: 단일 서버 처리를 위한 stumpy.stump 사용.
  • 분산 실행: 대규모 데이터셋을 위한 Dask Distributed를 통해 stumpy.stumped 사용.
  • GPU 가속: 고성능 컴퓨팅을 위한 stumpy.gpu_stump 사용.
  • 다차원 지원: 여러 시간 시리즈 차원을 동시에 분석하기 위한 stumpy.mstump 사용.

대상 사용자

STUMPY는 모티프 탐지, 이상 탐지, 의미적 세그멘테이션과 같은 시간 시리즈 데이터 마이닝 작업이 필요한 학계 연구자, 데이터 과학자, 소프트웨어 개발자를 대상으로 합니다.

주요 특징

  • 확장성: Dask를 통한 CPU, GPU, 분산 컴퓨팅을 지원합니다.
  • 다용도성: 1차원 및 다차원 시간 시리즈 모두 처리 가능합니다.
  • 포괄적인 도구 세트: 시간 시리즈 체인(ATSC) 및 의미적 세그멘테이션(FLUSS) 전용 함수 포함.
  • 고성능: Numba JIT 컴파일을 활용하여 효율적인 실행을 구현합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트