data-infra/cube-studio

cubestudio开源云原生一站式机器学习/深度学习/大模型AI平台/MaaS/mlops/人工智能平台/训推平台,算法全链路流程,多租户,算力租赁平台,token中转,拖拉拽任务流pipeline编排,多机多卡分布式训练,超参搜索,推理服务,VGPU虚拟化,云边端协同,边缘计算,自动化标注平台,deepseek等大模型sft微调/奖励模型/强化学习训练,vllm/ollama/mindie大模型多机推理,私有知识库llmops智能体,AI模型市场,支持国产异构算力调度,昇腾/寒武纪/海光/摩尔/沐曦等,支持ib/roce/RDMA,信创支持

解決する課題

CubeStudioは、アルゴリズムエンジニアが直面する反復的なエンジニアリングのオーバーヘッドを排除するために設計された、クラウドネイティブなワンストップAIプラットフォームです。データ準備、ラベリングから、開発、トレーニング、評価、デプロイメントに至るまでのAIライフサイクル全体を合理化し、インフラ管理(GPUの要求、環境設定、データフローの管理など)に費やされる時間を削減し、開発者がモデル構築に集中できるようにします。

仕組み

Kubernetesを基盤として構築されたCubeStudioは、異種コンピューティングリソース(NVIDIA、AMD、およびAscendやCambriconなどの様々な中国国内AIチップを含む)を管理します。以下のレイヤー構造を提供します:

  • Infrastructure: GPU/NPUのスケジューリング、vGPU仮想化、およびRDMA高速ネットワークを処理します。
  • Development: 一貫した環境を提供するため、ブラウザベースのIDE(JupyterLab、VSCode)およびイメージ管理を提供します。
  • Data Management: データ探索(SQLLab)、データセット管理、およびAI支援オートメーションを備えたマルチモーダル・ラベリングプラットフォームを統合します。
  • Training: ドラッグ&ドロップ式のPipelineオーケストレーターを使用してML/DLワークフローのDAGを構築し、分散トレーニング(PyTorch、TensorFlow、DeepSpeed)およびハイパーパラメータ探索をサポートします。
  • Deployment: モデルのバージョニングを管理し、A/Bテスト、カナリアリリース、オートスケーリングをサポートする推論サービスへのノーコードデプロイメントパスを提供します。

対象ユーザー

  • AIエンジニアおよびデータサイエンティスト: 低レベルのインフラ管理を行うことなく、フルMLライフサイクルのための統合された環境を必要とする方。
  • 企業: 国内ハードウェアをサポートし、データセキュリティ要件に準拠した、プライベートで主権的なAIプラットフォームを求める企業。
  • MLOpsチーム: 複数のクラスターにわたるマルチテナントのリソース割り当て、課金、およびモニタリングを管理する必要があるチーム。

ハイライト

  • 異種ハードウェアサポート: 幅広い国内AIチップ(Ascend、Cambricon、Hygonなど)およびARM/x86アーキテクチャとのネイティブな互換性。
  • フルスタックMLOps: データラベリングとETLから、LLM向けのSFT(Supervised Fine-Tuning)およびRLHFまでをカバー。
  • ドラッグ&ドロップ・パイプライン: ビジュアルインターフェースを介して複雑なワークフローのオーケストレーションを簡素化。
  • LLM対応: 高性能な大規模モデルの推論と微調整のために、vLLM、Ollama、MindIEの組み込みサポートを含む。
  • エンタープライズグレードのガバナンス: マルチテナンシー、RBAC、リソースクォータ、および詳細な計量/課金機能を備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト