awslabs/awsome-distributed-ai

Best practices, reference architectures, and examples for distributed AI training and inference on AWS.

解決的問題

本倉儲提供一組全面的參考架構與可執行範例,協助使用者在 AWS 基礎設施上部署與操作分散式 AI 訓練與推論工作負載。它簡化了複雜 GPU 叢集的設定、網路最佳化配置,以及為大型模型選擇合適的訓練或推論引擎的過程。

如何運作

此專案分為多個功能模組:

  • 架構:提供 CloudFormation 與 Terraform 模板,用於透過 SageMaker HyperPod、AWS ParallelCluster、AWS Parallel Computing Service (PCS) 和 Amazon EKS 部署計算叢集。
  • 範例:包含以框架為中心的範例(例如 PyTorch DDP/FSDP、Megatron-LM、NeMo),以及以使用案例為中心的訓練與推論示範(使用 vLLM 和 SGLang 等引擎)。
  • 自訂 AMI:使用 Packer 與 Ansible 建立這些環境的優化 Amazon Machine Images。
  • 驗證與可觀測性:包含 GPU 叢集健康檢查、PyTorch 環境驗證,以及使用 Prometheus 與 Grafana 的監控堆疊工具。
  • 微基準測試:提供透過 NCCL、NCCOM 與 NVSHMEM 評估網路與通訊效能的工具。

適用對象

專為需要在 AWS 上跨多個 GPU 與節點擴展 AI 工作負載的機器學習工程師與基礎設施架構師設計,特別適用於處理大型語言模型(LLM)及其他前沿 AI 模型的使用者。

主要亮點

  • 多計算支援:提供 HyperPod、EKS、ParallelCluster 與 PCS 的即用型模板。
  • 框架多樣性:支援 Megatron-LM、NeMo 與 FSDP 等主流分散式訓練框架。
  • 推論最佳化:提供 vLLM 與 SGLang 等高性能伺服引擎的範例。
  • 叢集健康工具:整合驗證與可觀測性工具,確保硬體與網路的穩定性。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案