kubeflow/mpi-operator

Kubernetes Operator for MPI-based applications (distributed training, HPC, etc.)

해결하는 문제

Kubernetes에서 다중 노드 및 GPU에 걸쳐 allreduce 스타일의 분산 학습을 조율하는 것은 일반적으로 복잡하므로, 이를 단순화합니다.

작동 방식

이 프로젝트는 MPIJob이라는 사용자 정의 리소스를 도입하는 Kubernetes Operator를 제공합니다. 사용자는 YAML 파일에 워커 수 및 GPU 요구 사항과 같은 학습 구성 정보를 정의합니다. Operator는 이 작업의 라이프사이클을 관리하며, 런처 및 워커 파드를 조율하여 분산 학습 작업을 실행합니다.

대상 사용자

MPI 기반 분산 학습 프레임워크를 사용하여 Kubernetes 클러스터에서 AI 학습 워크로드를 확장해야 하는 ML 엔지니어 및 플랫폼 운영자입니다.

주요 기능

  • GPU 가속을 지원하는 멀티노드 분산 학습을 지원합니다.
  • Intel MPI 및 MPICH와 같은 일반적인 MPI 구현과 통합됩니다.
  • 작업 생성, 성공, 실패 비율에 대한 메트릭을 노출하여 내장 모니터링을 제공합니다.
  • 더 넓은 Kubeflow 생태계와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트