awslabs/awsome-distributed-ai
Best practices, reference architectures, and examples for distributed AI training and inference on AWS.
解決的問題
本倉儲提供一組全面的參考架構與可執行範例,協助使用者在 AWS 基礎設施上部署與操作分散式 AI 訓練與推論工作負載。它簡化了複雜 GPU 叢集的設定、網路最佳化配置,以及為大型模型選擇合適的訓練或推論引擎的過程。
如何運作
此專案分為多個功能模組:
- 架構:提供 CloudFormation 與 Terraform 模板,用於透過 SageMaker HyperPod、AWS ParallelCluster、AWS Parallel Computing Service (PCS) 和 Amazon EKS 部署計算叢集。
- 範例:包含以框架為中心的範例(例如 PyTorch DDP/FSDP、Megatron-LM、NeMo),以及以使用案例為中心的訓練與推論示範(使用 vLLM 和 SGLang 等引擎)。
- 自訂 AMI:使用 Packer 與 Ansible 建立這些環境的優化 Amazon Machine Images。
- 驗證與可觀測性:包含 GPU 叢集健康檢查、PyTorch 環境驗證,以及使用 Prometheus 與 Grafana 的監控堆疊工具。
- 微基準測試:提供透過 NCCL、NCCOM 與 NVSHMEM 評估網路與通訊效能的工具。
適用對象
專為需要在 AWS 上跨多個 GPU 與節點擴展 AI 工作負載的機器學習工程師與基礎設施架構師設計,特別適用於處理大型語言模型(LLM)及其他前沿 AI 模型的使用者。
主要亮點
- 多計算支援:提供 HyperPod、EKS、ParallelCluster 與 PCS 的即用型模板。
- 框架多樣性:支援 Megatron-LM、NeMo 與 FSDP 等主流分散式訓練框架。
- 推論最佳化:提供 vLLM 與 SGLang 等高性能伺服引擎的範例。
- 叢集健康工具:整合驗證與可觀測性工具,確保硬體與網路的穩定性。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案