data-infra/cube-studio
cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持
解決する課題
CubeStudioは、統合されたクラウドネイティブプラットフォームを提供することで、機械学習ライフサイクル管理の複雑さに対処します。大規模なAI環境におけるリソース割り当て、ユーザー権限管理、およびマルチハードウェア・スケジューリングの課題を解決します。
仕組み
本プラットフォームは、クラウドネイティブアーキテクチャを利用して、さまざまなコンピューティングリソースとサービスを管理します。ユーザーおよびプロジェクト管理にはロールベースのアクセス制御(RBAC)システムを採用し、高度なスケジューリングを通じて多様なハードウェアをサポートします。また、さまざまなストレージソリューションと統合されており、エッジやサーバーレス環境を含む複数のKubernetesクラスターにわたって動作させることが可能です。
対象ユーザー
異種ハードウェアや分散クラスターにわたって、開発、トレーニング、推論サービスを含む機械学習タスクを管理するための集中型プラットフォームを必要とする組織や開発チーム向けに設計されています。
ハイライト
- 多様なハードウェアサポート: CPU、GPU (T4, V100, A100)、ARM64、および各種国内GPU (Hygon DCU, Huawei NPU, Cambricon MLU, 等) をサポート。
- 包括的なリソース管理: プロジェクト/ユーザー管理、RBAC、および開発、トレーニング、推論リソースの詳細な計量/課金機能を含む。
- 柔軟なデプロイ: 複数のKubernetesクラスター、エッジコンピューティングノード、およびサーバーレスモード (Tencent Cloud および Alibaba Cloud) をサポート。
- 広範なストレージ統合: NFS, CFS, OSS, NAS, COS, GlusterFS, CephFS, および S3/MinIO をサポート。
- 高度なネットワーキング: HTTPS、リバースプロキシ、およびさまざまなネットワークトンネリング方式をサポート。