microsoft/pai
Resource scheduling and cluster management for AI
解決的問題
OpenPAI 為組織提供一個全棧式平台,用於共享與管理強大的 AI 計算資源(如 GPU 和 FPGA 集群)以及常見的 AI 資產(如模型、資料和環境)。它透過提供一個中央化場所來執行完整的訓練流程,簡化 AI 的 IT 運維工作。
工作原理
OpenPAI 是一個基於 Kubernetes 建構的模組化平台,利用 Docker 技術將計算硬體與軟體解耦。這使得使用者可以在一致的環境中執行分散式任務,並在不同的深度學習框架之間自由切換。平台包含以下幾個核心元件:
- 作業編排與排程:使用 Framework Controller 和專用的 Kubernetes 排程擴充(HiveD)來支援多租戶 GPU 集群。
- 管理介面:提供 Web 介面、命令列工具(
paictl)以及 VS Code 插件,用於提交與監控作業。 - 資產管理:包含一個市場(Marketplace)用於共享作業範本與範例,並整合儲存管理功能,支援團隊間的資料共用。
- 硬體支援:支援本地部署、混合部署與公有雲部署,相容異構硬體,包括 CPU、GPU、FPGA 與 InfiniBand。
適用對象
- 叢集管理員:負責計算資源的部署、可用性與維護的 IT 專業人員。
- 叢集使用者:需要進行 AI 任務訓練與推論的機器學習與深度學習研究人員、資料科學家、學生與教師。
主要亮點
- 異構硬體支援:原生支援 GPU、FPGA 與 InfiniBand。
- 全棧解決方案:涵蓋從使用者認證、群組管理到作業執行時與錯誤分析的完整流程。
- Kubernetes 整合:與 Kubernetes 生態系統相容,同時為 AI 工作負載提供專用排程能力。
- 模組化架構:元件可依需求插入或客製化,滿足特定組織需求。
- 協作生態系統:整合市場,支援一鍵重現共享的 AI 作業。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案