ROCm/k8s-device-plugin

Kubernetes (k8s) device plugin to enable registration of AMD GPU to a container cluster

해결하는 문제

이 프로젝트는 Kubernetes 클러스터가 AMD GPU를 인식하고 사용할 수 있도록 합니다. 디바이스 플러그인 없이는 Kubernetes는 AMD GPU에서 제공하는 특정 하드웨어 가속을 필요로 하는 컴퓨팅 워크로드를 네이티브로 스케줄링할 수 없습니다.

작동 방식

Kubernetes 디바이스 플러그인 인터페이스를 구현하여 AMD GPU를 컨테이너 클러스터 내에서 스케줄 가능한 리소스로 등록할 수 있습니다. 일반적으로 AMD GPU를 탑재한 모든 노드에 DaemonSet 형태로 배포되어 하드웨어가 클러스터의 스케줄러에 노출되도록 합니다. 또한 AMD GPU Operator와 통합하여 보다 포괄적인 리소스 관리를 가능하게 합니다.

대상 사용자

기계 학습이나 고성능 컴퓨팅과 같은 계산 집약적인 작업에 AMD 하드웨어를 사용하는 Kubernetes 클러스터를 관리하는 시스템 관리자 및 DevOps 엔지니어.

주요 기능

  • Kubernetes 통합: AMD GPU를 표준 스케줄 가능한 리소스로 취급할 수 있도록 합니다.
  • 건강 모니터링: gRPC 소켓 서비스를 통해 GPU별 세부 건강 상태 감지를 실험적으로 지원합니다.
  • 유연한 배포: 표준 YAML 매니페스트 또는 Helm 차트를 통해 배포할 수 있습니다.
  • 노드 라벨링: 클러스터 노드에 추가 GPU 속성을 추가하는 노드 라벨러를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트