kubeflow/mpi-operator
Kubernetes Operator for MPI-based applications (distributed training, HPC, etc.)
해결하는 문제
Kubernetes에서 다중 노드 및 GPU에 걸쳐 allreduce 스타일의 분산 학습을 조율하는 것은 일반적으로 복잡하므로, 이를 단순화합니다.
작동 방식
이 프로젝트는 MPIJob이라는 사용자 정의 리소스를 도입하는 Kubernetes Operator를 제공합니다. 사용자는 YAML 파일에 워커 수 및 GPU 요구 사항과 같은 학습 구성 정보를 정의합니다. Operator는 이 작업의 라이프사이클을 관리하며, 런처 및 워커 파드를 조율하여 분산 학습 작업을 실행합니다.
대상 사용자
MPI 기반 분산 학습 프레임워크를 사용하여 Kubernetes 클러스터에서 AI 학습 워크로드를 확장해야 하는 ML 엔지니어 및 플랫폼 운영자입니다.
주요 기능
- GPU 가속을 지원하는 멀티노드 분산 학습을 지원합니다.
- Intel MPI 및 MPICH와 같은 일반적인 MPI 구현과 통합됩니다.
- 작업 생성, 성공, 실패 비율에 대한 메트릭을 노출하여 내장 모니터링을 제공합니다.
- 더 넓은 Kubeflow 생태계와 호환됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트