data-infra/cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

해결하는 문제

CubeStudio는 통합된 클라우드 네이티브 플랫폼을 제공함으로써 머신러닝 라이프사이클 관리의 복잡성을 해결합니다. 대규모 AI 환경에서의 리소스 할당, 사용자 권한 관리 및 멀티 하드웨어 스케줄링 문제를 해결합니다.

작동 방식

이 플랫폼은 클라우드 네이티브 아키텍처를 활용하여 다양한 컴퓨팅 리소스와 서비스를 관리합니다. 사용자 및 프로젝트 관리를 위해 역할 기반 액세스 제어(RBAC) 시스템을 사용하며, 고급 스케줄링을 통해 다양한 하드웨어를 지원합니다. 다양한 스토리지 솔루션과 통합되며 에지 및 서버리스 환경을 포함한 여러 Kubernetes 클러스터에서 작동할 수 있습니다.

대상 사용자

이 플랫폼은 이기종 하드웨어 및 분산 클러스터 전반에 걸쳐 개발, 학습 및 추론 서비스를 포함한 머신러닝 작업을 관리하기 위한 중앙 집중식 플랫폼이 필요한 조직 및 개발 팀을 위해 설계되었습니다.

주요 특징

  • 다양한 하드웨어 지원: CPU, GPU (T4, V100, A100), ARM64 및 다양한 국산 GPU (Hygon DCU, Huawei NPU, Cambricon MLU 등)를 지원합니다.
  • 포괄적인 리소스 관리: 프로젝트/사용자 관리, RBAC 및 개발, 학습, 추론 리소스에 대한 상세한 미터링/과금을 포함합니다.
  • 유연한 배포: 여러 Kubernetes 클러스터, 에지 컴퓨팅 노드 및 서버리스 모드 (Tencent Cloud 및 Alibaba Cloud)를 지원합니다.
  • 광범위한 스토리지 통합: NFS, CFS, OSS, NAS, COS, GlusterFS, CephFS 및 S3/MinIO를 지원합니다.
  • 고급 네트워킹: HTTPS, 리버스 프록시 및 다양한 네트워크 터널링 방법을 지원합니다.