NVIDIA/nvidia-resiliency-ext

NVIDIA Resiliency Extension is a python package for framework developers and users to implement fault-tolerant features. It improves the effective training time by minimizing the downtime due to failures and interruptions.

해결하는 문제

NVIDIA Resiliency Extension (NVRx)은 대규모 AI 훈련 중 생산성을 유지하는 문제를 해결합니다. 하드웨어 또는 소프트웨어 장애가 발생할 때 훈련 실행이 완전히 실패하는 것을 방지하고, 동일한 장애 지점까지의 진행 상황 손실을 최소화합니다.

작동 방식

NVRx는 PyTorch 기반 워크로드를 위해 장애를 자동으로 처리하는 모듈식 도구 세트를 제공합니다. 시스템 전체의 상태 확인과 장애 감지를 사용하여 효율을 저해하는 응답 없음 rank 또는 느린 "스트래글러"(GPU/CPU 성능 문제)를 식별합니다. 장애가 감지되면 컴퓨팅 노드의 재할당 없이 프로세스 내에서 훈련을 재시작할 수 있습니다. 또한 비동기 및 로컬 체크포인트를 위한 프레임워크를 제공하여 훈련 프로세스의 속도를 늦추지 않고 자주 효율적으로 진행 상황을 저장합니다.

대상 독자

대규모 AI 훈련을 수행하는 연구원 및 개발자, 특히 PyTorch, PyTorch Lightning 또는 NVIDIA NeMo를 사용하며 훈련 실행이 안정적이고 하드웨어 장애에 대한 복원력을 보장해야 하는 사용자.

주요 기능

  • 자동 재시작: 작업 내에서 훈련을 재시작하여 SLURM 노드 재할당의 필요성을 피합니다.
  • 장애 및 스트래글러 감지: GPU 및 CPU 성능을 모니터링하여 응답 없음 rank와 느린 노드를 식별합니다.
  • 효율적인 체크포인트: 비동기 및 로컬 체크포인트를 모두 지원하여 작업 손실을 줄입니다.
  • 프레임워크 통합: PyTorch Lightning 및 NVIDIA NeMo와 원활하게 통합됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트