awslabs/awsome-distributed-ai

Collection of best practices, reference architectures, model training examples and utilities to train large models on AWS.

What it solves

이 프로젝트는 AWS에서 분산 머신러닝 학습을 배포하고 최적화하는 과정을 단순화하기 위해 포괄적인 참조 아키텍처와 테스트 케이스를 제공합니다. 사용자가 대규모 모델을 위한 고성능 컴퓨팅 클러스터, 네트워킹 및 오케스트레이션 설정을 수동으로 구성하는 복잡성을 피할 수 있도록 도와줍니다.

How it works

이 저장소는 여러 기능 모듈로 구성되어 있습니다:

  • Architectures: SageMaker HyperPod, AWS ParallelCluster, AWS Batch, 및 Amazon EKS를 사용하여 컴퓨팅 환경을 배포포하는 CloudFormation 템플릿을 제공합니다.
  • Custom Images: Packer와 Ansible을 사용하여 학습용으로 최적화된 Amazon Machine Images (AMI) 및 컨테이너를 생성합니다.
  • Test Cases: 다양한 프레임워크 (PyTorch, Megatron-LM, JAX, NeMo) 및 병렬화 기술 (DDP, FSDP)에 대한 사전 구성된 예시를 제공하여 다양한 규모의 모델 학습을 검증증 검증합니다.
  • Validation & Observability: GPU 클러스터 상태 점검, PyTorch 환경 검증 및 Prometheus와 Grafana를 통한 모니터링 도구를 포함합니다.
  • Micro-benchmarks: 네트워크 통신 (NCCL, NCCOM, NVSHMEM) 및 전문가 병렬화 (MoE) 성능 테스트를 제공합니다.

Highlights

  • Multi-service support: HyperPod, EKS, ParallelCluster, 및 AWS Batch를 지원합니다.

  • Framework agnostic: PyTorch, JAX, 및 Megatron-LM의 테스트 케이스를 포함합니다.

  • Prompt-based modules: (Note: The user provided text doesn't contain this module, but I will follow the template structure if I'm provided with the

  • Performance focused: EFA モニタリング, GPU ヘルスチェック, および通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信通信

  • End-to-end guidance: LLM トレーニングクラスターの運用化に関するワークショップ and blog posts for operationalizing LLM training clusters.