microsoft/pai
Resource scheduling and cluster management for AI
解决的问题
OpenPAI 为组织提供了一个全栈式平台,用于共享和管理强大的 AI 计算资源(如 GPU 和 FPGA 集群)以及常见的 AI 资产(如模型、数据和环境)。它通过提供一个集中式场所来运行完整的训练流水线,简化了 AI 的 IT 运维工作。
工作原理
OpenPAI 是一个基于 Kubernetes 构建的模块化平台,利用 Docker 技术将计算硬件与软件解耦。这使得用户可以在一致的环境中运行分布式任务,并在不同的深度学习框架之间自由切换。平台包含以下几个核心组件:
- 作业编排与调度:使用 Framework Controller 和专用的 Kubernetes 调度扩展(HiveD)来支持多租户 GPU 集群。
- 管理接口:提供 Web 端门户、命令行工具(
paictl)以及 VS Code 扩展,用于提交和监控作业。 - 资产管理:包含一个市场(Marketplace)用于共享作业模板和示例,并集成存储管理功能,支持团队间的数据共享。
- 硬件支持:支持本地部署、混合部署和公有云部署,兼容异构硬件,包括 CPU、GPU、FPGA 和 InfiniBand。
适用人群
- 集群管理员:负责计算资源的部署、可用性和维护的 IT 专业人员。
- 集群用户:需要进行 AI 任务训练和推理的机器学习与深度学习研究人员、数据科学家、学生和教师。
主要亮点
- 异构硬件支持:原生支持 GPU、FPGA 和 InfiniBand。
- 全栈解决方案:涵盖从用户认证、组管理到作业运行时和错误分析的全流程。
- Kubernetes 集成:与 Kubernetes 生态系统兼容,同时为 AI 工作负载提供专用调度能力。
- 模块化架构:组件可按需插拔或定制,满足特定组织需求。
- 协作生态系统:集成市场,支持一键复现共享的 AI 作业。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目