awslabs/awsome-distributed-ai

Best practices, reference architectures, and examples for distributed AI training and inference on AWS.

解决的问题

本仓库提供了一套全面的参考架构和可运行示例,帮助用户在 AWS 基础设施上部署和运行分布式 AI 训练与推理工作负载。它简化了复杂 GPU 集群的搭建、网络优化配置,以及为大规模模型选择合适的训练或推理引擎的过程。

如何工作

该项目分为多个功能模块:

  • 架构:提供 CloudFormation 和 Terraform 模板,用于通过 SageMaker HyperPod、AWS ParallelCluster、AWS Parallel Computing Service (PCS) 和 Amazon EKS 部署计算集群。
  • 示例:包含以框架为中心的示例(如 PyTorch DDP/FSDP、Megatron-LM、NeMo)以及以用例为中心的训练和推理演示(使用 vLLM 和 SGLang 等引擎)。
  • 自定义 AMI:使用 Packer 和 Ansible 创建这些环境的优化 Amazon Machine Images。
  • 验证与可观测性:包含 GPU 集群健康检查、PyTorch 环境验证工具,以及使用 Prometheus 和 Grafana 的监控堆栈。
  • 微基准测试:提供通过 NCCL、NCCOM 和 NVSHMEM 评估网络和通信性能的工具。

适用人群

专为需要在 AWS 上跨多个 GPU 和节点扩展 AI 工作负载的机器学习工程师和基础设施架构师设计,尤其适用于处理大语言模型(LLM)及其他前沿 AI 模型的用户。

主要亮点

  • 多计算支持:提供 HyperPod、EKS、ParallelCluster 和 PCS 的即用型模板。
  • 框架多样性:支持 Megatron-LM、NeMo 和 FSDP 等主流分布式训练框架。
  • 推理优化:提供 vLLM 和 SGLang 等高性能推理引擎的示例。
  • 集群健康工具:集成验证与可观测性工具,确保硬件和网络的稳定性。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目