NVIDIA/NVSentinel

NVSentinel detects and remediates GPU faults on Kubernetes nodes

해결하는 문제

NVSentinel은 Kubernetes 클러스터에서 GPU 인프라의 신뢰성을 유지하는 문제를 해결합니다. GPU 노드의 하드웨어 및 소프트웨어 장애를 자동으로 탐지하고 복구하여, 고장 난 하드웨어가 AI 워크로드에 영향을 주는 것을 방지합니다. 장애가 발생한 노드는 자동으로 격리되고 복구됩니다.

작동 방식

NVSentinel은 탐지와 조치를 분리한 마이크로서비스 아키텍처를 사용합니다.

  1. 탐지: 확장 가능한 헬스 모니터 (GPU, Syslog, 클라우드 프로바이더, Kubernetes 오브젝트 모니터)가 장애를 탐지하고 gRPC를 통해 플랫폼 커넥터에 이벤트를 전송합니다.
  2. 지속성: 플랫폼 커넥터는 이 이벤트를 검증하고 MongoDB 데이터베이스에 저장하며, Kubernetes 노드 상태를 업데이트합니다.
  3. 복구: 독립적인 코어 모듈이 MongoDB의 변경 스트림을 모니터링합니다. 장애 유형에 따라 특정 조치를 트리거합니다: Fault Quarantine 모듈은 노드를 코든하고, Node Drainer는 워크로드를 제거하며, Fault Remediation 모듈은 외부 복구 워크플로우를 트리거하는 유지보수 CRD를 생성합니다.

대상 사용자

대규모 NVIDIA GPU 클러스터를 Kubernetes에서 관리하는 플랫폼 엔지니어 및 클러스터 관리자에게 적합합니다. 하드웨어 장애 발생 시 수동 개입을 줄이고 GPU 건강 관리를 자동화하고자 하는 분들께 추천합니다.

주요 특징

  • 자동화된 라이프사이클: 장애 탐지에서 노드 코딩, 워크로드 제거, 복구 트리거까지 전 과정을 자동으로 처리합니다.
  • 경량 통합: 헬스 모니터는 gRPC 인터페이스를 사용하고, 모듈 간 비동기 조율은 MongoDB 변경 스트림을 활용합니다.
  • 광범위한 GPU 지원: Hopper, Ampere, Blackwell, Ada Lovelace 등 여러 NVIDIA 아키텍처에서 검증되었습니다.
  • 확장 가능한 설계: 모듈식 아키텍처를 통해 사용자 정의 헬스 모니터 및 드레인 플러그인을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트