data-infra/cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

解决的问题

CubeStudio 是一个云原生、一站式 AI 平台,旨在消除算法工程师面临的重复性工程开销。它简化了整个 AI 生命周期——从数据准备和标注到开发、训练、评估和部署——减少了在基础设施管理(如申请 GPU、配置环境和管理数据流)上花费的时间,让开发者能够专注于模型构建。

工作原理

CubeStudio 构建在 Kubernetes 基础之上,管理异构计算资源(包括 NVIDIA、AMD 以及各种国产 AI 芯片,如 Ascend 和 Cambricon)。它提供分层架构:

  • Infrastructure:处理 GPU/NPU 调度、vGPU 虚拟化和 RDMA 高速网络。
  • Development:提供基于浏览器的 IDE(JupyterLab、VSCode)和镜像管理,以实现一致的环境。
  • Data Management:集成数据探索 (SQLLab)、数据集管理以及具有 AI 辅助自动化的多模态标注平台。
  • Training:使用拖拽式 Pipeline 编排器为 ML/DL 工作流构建 DAG,支持分布式训练 (PyTorch, TensorFlow, DeepSpeed) 和超参数搜索。
  • Deployment:管理模型版本,并提供通往推理服务的零代码部署路径,支持 A/B 测试、金丝雀发布和自动扩缩容。

适用对象

  • AI 工程师和数据科学家:需要统一的完整 ML 生命周期环境,而无需管理底层基础设施。
  • 企业:寻求支持国产硬件并符合数据安全要求的私有、主权 AI 平台。
  • MLOps 团队:需要在多个集群中管理多租户资源分配、计费和监控。

亮点

  • 异构硬件支持:与广泛的国产 AI 芯片(Ascend, Cambricon, Hygon 等)及 ARM/x86 架构原生兼容。
  • 全栈 MLOps:涵盖从数据标注和 ETL 到针对 LLM 的 SFT(监督微调)和 RLHF 的所有环节。
  • 拖拽式流水线:通过可视化界面简化复杂的流程编排。
  • LLM 就绪:内置对 vLLM、Ollama 和 MindIE 的支持,用于高性能大模型推理和微调。
  • 企业级治理:具备多租户、RBAC、资源配额以及详细的计量/计费功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目