data-infra/cube-studio
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持
解决的问题
CubeStudio 是一个云原生、一站式 AI 平台,旨在消除算法工程师面临的重复性工程开销。它简化了整个 AI 生命周期——从数据准备和标注到开发、训练、评估和部署——减少了在基础设施管理(如申请 GPU、配置环境和管理数据流)上花费的时间,让开发者能够专注于模型构建。
工作原理
CubeStudio 构建在 Kubernetes 基础之上,管理异构计算资源(包括 NVIDIA、AMD 以及各种国产 AI 芯片,如 Ascend 和 Cambricon)。它提供分层架构:
- Infrastructure:处理 GPU/NPU 调度、vGPU 虚拟化和 RDMA 高速网络。
- Development:提供基于浏览器的 IDE(JupyterLab、VSCode)和镜像管理,以实现一致的环境。
- Data Management:集成数据探索 (SQLLab)、数据集管理以及具有 AI 辅助自动化的多模态标注平台。
- Training:使用拖拽式 Pipeline 编排器为 ML/DL 工作流构建 DAG,支持分布式训练 (PyTorch, TensorFlow, DeepSpeed) 和超参数搜索。
- Deployment:管理模型版本,并提供通往推理服务的零代码部署路径,支持 A/B 测试、金丝雀发布和自动扩缩容。
适用对象
- AI 工程师和数据科学家:需要统一的完整 ML 生命周期环境,而无需管理底层基础设施。
- 企业:寻求支持国产硬件并符合数据安全要求的私有、主权 AI 平台。
- MLOps 团队:需要在多个集群中管理多租户资源分配、计费和监控。
亮点
- 异构硬件支持:与广泛的国产 AI 芯片(Ascend, Cambricon, Hygon 等)及 ARM/x86 架构原生兼容。
- 全栈 MLOps:涵盖从数据标注和 ETL 到针对 LLM 的 SFT(监督微调)和 RLHF 的所有环节。
- 拖拽式流水线:通过可视化界面简化复杂的流程编排。
- LLM 就绪:内置对 vLLM、Ollama 和 MindIE 的支持,用于高性能大模型推理和微调。
- 企业级治理:具备多租户、RBAC、资源配额以及详细的计量/计费功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目