microsoft/pai

Resource scheduling and cluster management for AI

해결하는 문제

OpenPAI는 GPU 및 FPGA와 같은 강력한 AI 컴퓨팅 리소스(예: GPU 팜, FPGA 팜)와 모델, 데이터, 환경과 같은 공통 AI 자산을 조직 내에서 공유하고 관리할 수 있는 풀스택 플랫폼을 제공합니다. 이는 AI를 위한 IT 운영을 단순화하고 완전한 트레이닝 파이프라인을 실행할 수 있는 중앙 집중식 장소를 제공합니다.

작동 방식

OpenPAI는 Kubernetes 위에 구축된 모듈식 플랫폼으로, Docker 기술을 사용하여 컴퓨팅 하드웨어와 소프트웨어를 분리합니다. 이로 인해 사용자는 분산 작업을 실행하고 일관된 환경에서 다양한 딥러닝 프레임워크를 전환할 수 있습니다. 주요 구성 요소는 다음과 같습니다:

  • 작업 오케스트레이션 및 스케줄링: 다중 테넌트 GPU 클러스터를 위한 Framework Controller와 전용 Kubernetes 스케줄러 확장기(HiveD) 사용.
  • 관리 인터페이스: 웹 포털, 명령줄 도구(paictl), VS Code 확장 기능을 통해 작업 제출 및 모니터링 지원.
  • 자산 관리: 작업 템플릿과 예제를 공유하는 마켓플레이스와 팀 기반 데이터 공유를 위한 통합 스토리지 관리 기능 포함.
  • 하드웨어 지원: 온프레미스, 하이브리드, 공공 클라우드 배포를 지원하며, CPU, GPU, FPGA, InfiniBand을 포함한 이종 하드웨어를 지원합니다.

대상 사용자

  • 클러스터 관리자: 컴퓨팅 리소스의 배포, 가용성, 유지보수를 담당하는 IT 전문가.
  • 클러스터 사용자: 머신러닝 및 딥러닝 연구자, 데이터 과학자, 학생, 교사 등 AI 작업의 트레이닝 및 서비스가 필요한 사용자.

주요 특징

  • 이종 하드웨어 지원: GPU, FPGA, InfiniBand에 대한 네이티브 지원.
  • 풀스택 솔루션: 사용자 인증, 그룹 관리, 작업 런타임, 오류 분석까지 모든 영역을 커버.
  • Kubernetes 통합: Kubernetes 생태계와 호환되며, AI 워크로드를 위한 전용 스케줄링 제공.
  • 모듈식 아키텍처: 조직의 필요에 맞게 구성 요소를 추가하거나 커스터마이징 가능.
  • 협업 생태계: 공유된 AI 작업을 한 번의 클릭으로 재현할 수 있는 통합 마켓플레이스.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트