awslabs/awsome-distributed-ai
Best practices, reference architectures, and examples for distributed AI training and inference on AWS.
해결하는 문제
이 리포지토리는 AWS 인프라에서 분산 AI 학습 및 추론 워크로드를 배포하고 운영하는 데 도움이 되는 포괄적인 리퍼런스 아키텍처와 실행 가능한 예제를 제공합니다. 복잡한 GPU 클러스터 설정, 네트워크 최적화 구성, 대규모 모델용 적절한 학습 또는 추론 엔진 선택을 간소화합니다.
작동 방식
이 프로젝트는 여러 기능 모듈로 구성되어 있습니다:
- 아키텍처: SageMaker HyperPod, AWS ParallelCluster, AWS Parallel Computing Service (PCS), Amazon EKS를 사용한 컴퓨팅 클러스터 배포를 위한 CloudFormation 및 Terraform 템플릿 제공.
- 예제: PyTorch DDP/FSDP, Megatron-LM, NeMo와 같은 프레임워크 중심 예제 및 vLLM, SGLang 같은 엔진을 사용한 학습 및 추론용 사용 사례 중심 데모 포함.
- 사용자 정의 AMI: Packer와 Ansible를 사용하여 이러한 환경용 최적화된 Amazon Machine Images 생성.
- 검증 및 관측성: GPU 클러스터 건강 상태 점검, PyTorch 환경 검증, Prometheus 및 Grafana를 사용한 모니터링 스택 포함 도구.
- 마이크로 벤치마크: NCCL, NCCOM, NVSHMEM를 통해 네트워크 및 통신 성능 평가를 위한 도구 제공.
대상 사용자
다수의 GPU와 노드를 통해 AWS에서 AI 워크로드를 확장해야 하는 머신러닝 엔지니어 및 인프라 아키텍트를 위한 것입니다. 특히 대규모 언어 모델(LLM) 및 기타 최전방 AI 모델을 다루는 분들에게 적합합니다.
주요 특징
- 다중 컴퓨팅 지원: HyperPod, EKS, ParallelCluster, PCS용 즉시 사용 가능한 템플릿.
- 프레임워크 다양성: Megatron-LM, NeMo, FSDP와 같은 주요 분산 학습 프레임워크 지원.
- 추론 최적화: vLLM, SGLang과 같은 고성능 서빙 엔진 예제 제공.
- 클러스터 건강 도구: 하드웨어 및 네트워크 안정성을 보장하기 위한 통합 검증 및 관측성 도구.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트