kubernetes-sigs/dra-driver-nvidia-gpu
DRA Driver for NVIDIA GPUs
해결하는 문제
이 프로젝트는 Dynamic Resource Allocation (DRA) 프레임워크를 사용하여 Kubernetes 클러스터 내에서 NVIDIA GPU를 유연하게 할당하고 구성하는 방법을 제공합니다. 고성능 AI 워크로드를 위한 동적 재구성 및 안전한 다중 노드 NVLink (MNNVL) 연결 오케스트레이션과 같은 더 강력한 GPU 관리의 필요성을 해결합니다.
작동 방식
이 드라이버는 두 가지 주요 kubelet 플러그인으로 구성되어 있으며, 각각 다른 리소스 유형을 관리합니다.
- ComputeDomains: 이 플러그인은 다중 노드 NVLink를 사용하여 포드 간의 안전하고 격리된 접근성을 보장하는 추상화를 관리하며, 워크로드가 노드 간에 효율적으로 통신할 수 있도록 합니다.
- GPUs: 이 플러그인은 GPU 장치의 할당을 처리하여 다중 인스턴스 GPU (MIG) 장치의 동적 할당과 같은 기능을 가능하게 합니다.
대상 사용자
대규모 AI 학습 또는 추론을 위해 특수한 NVIDIA 하드웨어를 관리해야 하는 Kubernetes 관리자 및 AI 인프라 엔지니어를 위한 것입니다. 특히 NVIDIA GB200 시스템을 사용하거나 다중 노드 GPU 통신이 필요한 사용자에게 적합합니다.
주요 특징
- 다중 노드 NVLink 지원: 서로 다른 노드 간 포드 간에 안전하고 강력한 연결을 오케스트레이션합니다.
- 동적 리소스 할당: Kubernetes DRA 프레임워크를 활용하여 리소스 구성 권한을 제3자 벤더에게 위임합니다.
- 유연한 GPU 공유: 동일한 포드 내 여러 컨테이너 간에 하나의 GPU를 공유할 수 있습니다.
- 임시 ComputeDomains: 소비 워크로드의 수명 동안만 존재하는 격리된 통신 도메인을 생성합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트