data-infra/cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

解決的問題

CubeStudio 是一個雲原生、一站式 AI 平台,旨在消除演算法工程師面臨的重複性工程開銷。它簡化了整個 AI 生命週期——從數據準備和標註到開發、訓練、評估和部署——減少了在基礎設施管理(如申請 GPU、配置環境和管理數據流)上花費的時間,讓開發者能夠專注於模型構建。

工作原理

CubeStudio 構建在 Kubernetes 基礎之上,管理異構計算資源(包括 NVIDIA、AMD 以及各種國產 AI 晶片,如 Ascend 和 Cambricon)。它提供分層架構:

  • Infrastructure:處理 GPU/NPU 調度、vGPU 虛擬化和 RDMA 高速網路。
  • Development:提供基於瀏覽器的 IDE(JupyterLab、VSCode)和鏡像管理,以實現一致的環境。
  • Data Management:集成數據探索 (SQLLab)、數據集管理以及具有 AI 輔助自動化的多模態標註平台。
  • Training:使用拖拽式 Pipeline 編排器為 ML/DL 工作流構建 DAG,支援分散式訓練 (PyTorch, TensorFlow, DeepSpeed) 和超參數搜索。
  • Deployment:管理模型版本,並提供通往推理服務的零代碼部署路徑,支援 A/B 測試、金絲雀發佈和自動擴縮容。

適用對象

  • AI 工程師和數據科學家:需要統一的完整 ML 生命週期環境,而無需管理底層基礎設施。
  • 企業:尋求支援國產硬體並符合數據安全要求的私有、主權 AI 平台。
  • MLOps 團隊:需要在多個集群中管理多租戶資源分配、計費和監控。

亮點

  • 異構硬體支援:與廣泛的國產 AI 晶片(Ascend, Cambricon, Hygon 等)及 ARM/x86 架構原生相容。
  • 全棧 MLOps:涵蓋從數據標註和 ETL 到針對 LLM 的 SFT(監督微調)和 RLHF 的所有環節。
  • 拖拽式流水線:透過視覺化介面簡化複雜的流程編排。
  • LLM 就緒:內建對 vLLM、Ollama 和 MindIE 的支援,用於高性能大模型推理和微調。
  • 企業級治理:具備多租戶、RBAC、資源配額以及詳細的計量/計費功能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案