awslabs/awsome-distributed-ai
Best practices, reference architectures, and examples for distributed AI training and inference on AWS.
解决的问题
本仓库提供了一套全面的参考架构和可运行示例,帮助用户在 AWS 基础设施上部署和运行分布式 AI 训练与推理工作负载。它简化了复杂 GPU 集群的搭建、网络优化配置,以及为大规模模型选择合适的训练或推理引擎的过程。
如何工作
该项目分为多个功能模块:
- 架构:提供 CloudFormation 和 Terraform 模板,用于通过 SageMaker HyperPod、AWS ParallelCluster、AWS Parallel Computing Service (PCS) 和 Amazon EKS 部署计算集群。
- 示例:包含以框架为中心的示例(如 PyTorch DDP/FSDP、Megatron-LM、NeMo)以及以用例为中心的训练和推理演示(使用 vLLM 和 SGLang 等引擎)。
- 自定义 AMI:使用 Packer 和 Ansible 创建这些环境的优化 Amazon Machine Images。
- 验证与可观测性:包含 GPU 集群健康检查、PyTorch 环境验证工具,以及使用 Prometheus 和 Grafana 的监控堆栈。
- 微基准测试:提供通过 NCCL、NCCOM 和 NVSHMEM 评估网络和通信性能的工具。
适用人群
专为需要在 AWS 上跨多个 GPU 和节点扩展 AI 工作负载的机器学习工程师和基础设施架构师设计,尤其适用于处理大语言模型(LLM)及其他前沿 AI 模型的用户。
主要亮点
- 多计算支持:提供 HyperPod、EKS、ParallelCluster 和 PCS 的即用型模板。
- 框架多样性:支持 Megatron-LM、NeMo 和 FSDP 等主流分布式训练框架。
- 推理优化:提供 vLLM 和 SGLang 等高性能推理引擎的示例。
- 集群健康工具:集成验证与可观测性工具,确保硬件和网络的稳定性。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目