mhahsler/dbscan

Density Based Clustering of Applications with Noise (DBSCAN) and Related Algorithms - R package

해결하는 문제

이 패키지는 밀도 기반 클러스터링 및 이상치 탐지 알고리즘의 빠른 C++ 구현을 제공하며, 특히 공간 데이터를 위해 설계되었습니다. 사용자는 전통적인 거리 기반 클러스터링이 실패할 수 있는 데이터셋에서 임의의 형태의 클러스터를 식별하고 노이즈 포인트(이상치)를 탐지할 수 있습니다.

작동 방식

이 라이브러리는 DBSCAN, HDBSCAN, OPTICS, SNN을 포함한 DBSCAN 계열의 여러 알고리즘을 구현합니다. 높은 성능을 달성하기 위해 kd-tree 데이터 구조(ANN 라이브러리를 통해)를 사용하여 빠른 k-최근접 이웃 및 고정 반경 최근접 이웃 탐색을 수행하며, 유클리드 거리의 경우 네이티브 R 또는 Python scikit-learn 구현보다 일반적으로 더 빠릅니다.

대상 사용자

주로 공간 또는 수치 데이터셋에서 밀도 기반 클러스터링이나 이상치 탐지를 수행해야 하는 R 사용자(데이터 과학자 및 연구자)를 위한 것입니다(rpy2를 통해 Python에서도 접근 가능).

주요 특징

  • 포괄적인 알고리즘 스위트: DBSCAN, HDBSCAN, OPTICS, FOSC, Jarvis-Patrick, SNN 클러스터링을 포함합니다.
  • 이상치 탐지: LOF(로컬 아웃라이어 팩터) 및 GLOSH 알고리즘을 제공합니다.
  • 클러스터 평가: DBCV(밀도 기반 클러스터링 검증)를 구현합니다.
  • Tidyverse 통합: ggplot2 및 tidymodels와의 원활한 사용을 위해 tidy(), augment(), glance() 메서드를 제공합니다.
  • 고성능: 빠른 최근접 이웃 탐색을 위한 kd-tree 최적화를 갖춘 C++ 백엔드.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트