data-infra/cube-studio
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持
解决的问题
CubeStudio 通过提供统一的云原生平台,解决了机器学习生命周期管理的复杂性。它解决了大规模 AI 环境中的资源分配、用户权限管理和多硬件调度挑战。
工作原理
该平台利用云原生架构来管理各种计算资源和服务。它采用基于角色的访问控制 (RBAC) 系统进行用户和项目管理,并通过高级调度支持多种硬件。它能与各种存储解决方案集成,并可以在包括边缘和无服务器环境在内的多个 Kubernetes 集群中运行。
适用对象
专为需要集中式平台来管理异构硬件和分布式集群上的机器学习任务(包括开发、训练和推理服务)的组织和开发团队而设计。
亮点
- 多样化的硬件支持:支持 CPU、GPU (T4, V100, A100)、ARM64 以及各种国产 GPU (海光 DCU、华为 NPU、寒武纪 MLU 等)。
- 全面的资源管理:包括项目/用户管理、RBAC,以及针对开发、训练和推理资源的详细计量/计费。
- 灵活的部署:支持多个 Kubernetes 集群、边缘计算节点和无服务器模式 (腾讯云和阿里云)。
- 广泛的存储集成:支持 NFS、CFS、OSS、NAS、COS、GlusterFS、CephFS 和 S3/MinIO。
- 高级网络功能:支持 HTTPS、反向代理和各种网络隧道方法。