data-infra/cube-studio
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持
해결하는 문제
CubeStudio는 알고리즘 엔지니어가 직면하는 반복적인 엔지니어링 오버헤드를 제거하기 위해 설계된 클라우드 네이티브 원스톱 AI 플랫폼입니다. 데이터 준비 및 라벨링부터 개발, 학습, 평가 및 배포에 이르는 전체 AI 라이프사이클을 간소화하여, 개발자가 모델 구축에 집중할 수 있도록 인프라 관리(GPU 요청, 환경 구성, 데이터 흐름 관리 등)에 소요되는 시간을 줄여줍니다.
작동 방식
Kubernetes를 기반으로 구축된 CubeStudio는 이기종 컴퓨팅 리소스(NVIDIA, AMD 및 Ascend, Cambricon과 같은 다양한 중국 국산 AI 칩 포함)를 관리합니다. 다음과 같은 계층형 아키텍처를 제공합니다:
- Infrastructure: GPU/NPU 스케줄링, vGPU 가상화 및 RDMA 고속 네트워킹을 처리합니다.
- Development: 일관된 환경을 위해 브라우저 기반 IDE(JupyterLab, VSCode) 및 이미지 관리를 제공합니다.
- Data Management: 데이터 탐색(SQLLab), 데이터셋 관리 및 AI 지원 자동화 기능이 있는 멀티모달 라벨링 플랫폼을 통합합니다.
- Training: 드래그 앤 드롭 방식의 Pipeline 오케스트레이터를 사용하여 ML/DL 워크플로우를 위한 DAG를 구축하며, 분산 학습(PyTorch, TensorFlow, DeepSpeed) 및 하이퍼파라미터 탐색을 지원합니다.
- Deployment: 모델 버전 관리를 수행하고 A/B 테스트, 카나리 릴리스 및 오토스케일링을 지원하는 추론 서비스로의 노코드 배포 경로를 제공합니다.
대상 사용자
- AI 엔지니어 및 데이터 과학자: 저수준 인프라를 관리할 필요 없이 전체 ML 라이프사이클을 위한 통합된 환경이 필요한 전문가.
- 기업: 국산 하드웨어를 지원하고 데이터 보안 요구 사항을 준수하는 프라이빗하고 주권적인 AI 플랫폼을 찾는 기업.
- MLOps 팀: 여러 클러스터에 걸쳐 멀티테넌트 리소스 할당, 과금 및 모니터링을 관리해야 하는 팀.
주요 특징
- 이기종 하드웨어 지원: 다양한 국산 AI 칩(Ascend, Cambricon, Hygon 등) 및 ARM/x86 아키텍처와 네이티브 호환.
- 풀스택 MLOps: 데이터 라벨링 및 ETL부터 LLM을 위한 SFT(Supervised Fine-Tuning) 및 RLHF까지 모두 포함.
- 드래그 앤 드롭 파이프라인: 시각적 인터페이스를 통해 복잡한 워크플로우 오케스트레이션을 단순화.
- LLM 준비 완료: 고성능 대규모 모델 추론 및 미세 조정을 위해 vLLM, Ollama, MindIE에 대한 내장 지원 포함.
- 엔터프라이즈급 거버넌스: 멀티테넌시, RBAC, 리소스 할당량 및 상세한 사용량 측정/과금 기능 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트