awslabs/awsome-distributed-ai

Best practices, reference architectures, and examples for distributed AI training and inference on AWS.

何を解決するか

このリポジトリは、AWSインフラ上での分散AI学習および推論ワークロードのデプロイと運用を支援する包括的なリファレンスアーキテクチャと実行可能な例を提供します。複雑なGPUクラスタのセットアップ、ネットワーク最適化の構成、大規模モデル向けの適切な学習または推論エンジンの選定を簡素化します。

仕組み

プロジェクトは以下の機能モジュールに分かれています:

  • アーキテクチャ: SageMaker HyperPod、AWS ParallelCluster、AWS Parallel Computing Service (PCS)、Amazon EKS を使用したコンピューティングクラスタのデプロイに向けた CloudFormation および Terraform テンプレートを提供。
  • : PyTorch DDP/FSDP、Megatron-LM、NeMo などのフレームワーク中心の例、および vLLM や SGLang などのエンジンを使用した学習・推論用のユースケース中心のデモを含む。
  • カスタム AMI: Packer と Ansible を使用して、これらの環境向けに最適化された Amazon Machine Images を作成。
  • 検証と可観測性: GPUクラスタの健全性チェック、PyTorch環境の検証、Prometheus と Grafana を使用したモニタリングスタックを含むツール。
  • マイクロベンチマーク: NCCL、NCCOM、NVSHMEM を通じたネットワークおよび通信性能の評価に使用するツール。

対象ユーザー

複数のGPUおよびノードにわたるAIワークロードをAWS上でスケーリングする必要がある機械学習エンジニアおよびインフラアーキテクト向けです。特に大規模言語モデル(LLM)やその他の先端AIモデルに取り組んでいる方々に適しています。

主な特徴

  • マルチコンピューティング対応: HyperPod、EKS、ParallelCluster、PCS 用の即時利用可能なテンプレート。
  • フレームワークの多様性: Megatron-LM、NeMo、FSDP などの主要な分散学習フレームワークをサポート。
  • 推論最適化: vLLM や SGLang などの高性能サーバー用エンジンの例を提供。
  • クラスタ健全性ツール: ハードウェアおよびネットワークの安定性を確保する統合された検証および可観測性ツール。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト