NVIDIA/deepops

Tools for building GPU clusters

何を解決するか

DeepOpsは、GPUアクセラレーテッドサーバークラスターの展開と管理という複雑なプロセスを簡素化します。ドライバー、コンテナランタイム、クラスターマネージャーなどの必要なソフトウェアスタックのセットアップを自動化することで、研究者やエンジニアがAIワークロードの実行に集中できるようにします。手動でのインフラ構成に時間を費やす必要がなくなります。

動作方法

DeepOpsはAnsibleプレイブックを使用してGPU環境のインストールと構成をオーケストレーションします。ユーザーのニーズに応じて、以下の機能が可能です:

  • Kubesprayを使用してコンテナ化されたアプリケーション管理用の完全なKubernetesクラスターを展開。
  • 伝統的なバッチジョブスケジューリングとリソース管理用のSlurmクラスターをセットアップ。
  • 単一マシンに必須のNVIDIAコンポーネント(ドライバー、Docker、NVIDIAコンテナランタイム)をインストール。
  • サポートされているシステムにNVIDIA DGXソフトウェアスタックをデプロイ。

対象ユーザー

オンプレミスデータセンター、NVIDIA DGXシステム、またはAIトレーニングや推論に高パフォーマンスGPUクラスターを必要とする任意のベアメタル環境を管理するシステム管理者およびMLエンジニア向けに設計されています。

主な特徴

  • 柔軟なデプロイ: クラスター全体のオーケストレーションまたはKubeFlowやNFSストレージなどの特定コンポーネントのモジュール化インストールをサポート。
  • マルチスケジューラ対応: Kubernetes(コンテナ中心)とSlurm(ジョブ中心)の両方の環境に対する自動化されたパスを提供。
  • DGX最適化: NVIDIA DGXシステムおよびDGX OSに特化して最適化されています。
  • 広範なOS互換性: Ubuntu 22.04/24.04 LTSおよびNVIDIA DGX OS 6/7で検証済み。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト