data-infra/cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

解決的問題

CubeStudio 透過提供統一的雲原生平台,解決了機器學習生命週期管理的複雜性。它解決了大規模 AI 環境中的資源分配、使用者權限管理以及多硬體調度的挑戰。

工作原理

該平台利用雲原生架構來管理各種運算資源與服務。它採用基於角色的存取控制 (RBAC) 系統進行使用者與專案管理,並透過進階調度支援多種硬體。它能與各種儲存解決方案整合,並可以在包括邊緣與無伺服器環境在內的多個 Kubernetes 集群中運行。

適用對象

專為需要集中式平台來管理異構硬體與分散式集群上的機器學習任務(包括開發、訓練與推理服務)的組織與開發團隊而設計。

亮點

  • 多樣化的硬體支援:支援 CPU、GPU (T4, V100, A100)、ARM64 以及各種國產 GPU (海光 DCU、華為 NPU、寒武紀 MLU 等)。
  • 全面的資源管理:包括專案/使用者管理、RBAC,以及針對開發、訓練與推理資源的詳細計量/計費。
  • 靈活的部署:支援多個 Kubernetes 集群、邊緣運算節點與無伺服器模式 (騰訊雲與阿里雲)。
  • 廣泛的儲存整合:支援 NFS、CFS、OSS、NAS、COS、GlusterFS、CephFS 與 S3/MinIO。
  • 進階網路功能:支援 HTTPS、反向代理與各種網路隧道方法。