microsoft/pai

Resource scheduling and cluster management for AI

解决的问题

OpenPAI 为组织提供了一个全栈式平台,用于共享和管理强大的 AI 计算资源(如 GPU 和 FPGA 集群)以及常见的 AI 资产(如模型、数据和环境)。它通过提供一个集中式场所来运行完整的训练流水线,简化了 AI 的 IT 运维工作。

工作原理

OpenPAI 是一个基于 Kubernetes 构建的模块化平台,利用 Docker 技术将计算硬件与软件解耦。这使得用户可以在一致的环境中运行分布式任务,并在不同的深度学习框架之间自由切换。平台包含以下几个核心组件:

  • 作业编排与调度:使用 Framework Controller 和专用的 Kubernetes 调度扩展(HiveD)来支持多租户 GPU 集群。
  • 管理接口:提供 Web 端门户、命令行工具(paictl)以及 VS Code 扩展,用于提交和监控作业。
  • 资产管理:包含一个市场(Marketplace)用于共享作业模板和示例,并集成存储管理功能,支持团队间的数据共享。
  • 硬件支持:支持本地部署、混合部署和公有云部署,兼容异构硬件,包括 CPU、GPU、FPGA 和 InfiniBand。

适用人群

  • 集群管理员:负责计算资源的部署、可用性和维护的 IT 专业人员。
  • 集群用户:需要进行 AI 任务训练和推理的机器学习与深度学习研究人员、数据科学家、学生和教师。

主要亮点

  • 异构硬件支持:原生支持 GPU、FPGA 和 InfiniBand。
  • 全栈解决方案:涵盖从用户认证、组管理到作业运行时和错误分析的全流程。
  • Kubernetes 集成:与 Kubernetes 生态系统兼容,同时为 AI 工作负载提供专用调度能力。
  • 模块化架构:组件可按需插拔或定制,满足特定组织需求。
  • 协作生态系统:集成市场,支持一键复现共享的 AI 作业。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目