NVIDIA/cuml

NVIDIA cuML: GPU-Accelerated Machine Learning

해결하는 문제

cuML은 CPU 기반 기계학습의 성능 한계를 극복하기 위해 설계되었습니다. NVIDIA GPU에서 기계학습 워크로드를 실행하여 일부 벤치마크에서 scikit-learn보다 최대 50배 빠른 성능을 달성할 수 있습니다.

작동 방식

이 라이브러리는 GPU 가속을 위한 두 가지 주요 방법을 제공합니다:

  1. GPU 네이티브 API: scikit-learn 스타일의 fit-predict-transform 패턴을 사용하는 cuml Python API로, 데이터와 계산이 모두 GPU 위에서 유지됩니다.
  2. 투명한 가속: cuml.accel 모듈을 사용하면 기존의 scikit-learn, UMAP, HDBSCAN 코드를 변경하지 않고 GPU 가속을 적용할 수 있으며, 가속이 불가능한 연산은 CPU로 자동 전환됩니다.

대규모 데이터셋의 경우 cuml.dask API를 통해 Dask를 사용하여 여러 GPU 및 멀티노드 클러스터에서 분산 실행이 가능합니다.

대상 사용자

scikit-learn을 사용하고 있으며, 더 큰 데이터셋으로 워크플로우를 확장하거나 NVIDIA GPU를 활용해 학습 및 추론 시간을 단축하고자 하는 데이터 과학자 및 머신러닝 엔지니어.

주요 특징

  • scikit-learn 호환성: 익숙한 API를 제공하며 scikit-learn 버전 1.6 이상과 호환됩니다.
  • 고성능: 대표적인 벤치마크에서 워크플로우를 최대 50배 가속화합니다.
  • 코드 변경 없이 가속: cuml.accel을 통해 기존 스크립트의 소스 코드를 수정하지 않고 GPU 가속을 적용할 수 있습니다.
  • 멀티 GPU 스케일링: cuml.dask를 통해 분산 기계학습을 지원합니다.
  • 광범위한 알고리즘 지원: 클러스터링, 차원 축소, 회귀, 분류, 전처리, 시계열 분석 등을 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트