kubernetes-sigs/dra-driver-nvidia-gpu

DRA Driver for NVIDIA GPUs

何を解決するか

このプロジェクトは、Dynamic Resource Allocation (DRA) フレームワークを使用して、Kubernetes クラスタ内で NVIDIA GPU を柔軟に割り当ておよび構成する方法を提供します。高パフォーマンスな AI ワークロード向けに、動的再構成や安全なマルチノード NVLink (MNNVL) 接続のオーケストレーションといった、より強力な GPU 管理のニーズに対応します。

動作方法

ドライバは、異なるリソースタイプを管理する2つの主要な kubelet プラグインで構成されています。

  • ComputeDomains: このプラグインは、マルチノード NVLink を使用してポッド間の安全で隔離された到達可能性を保証する抽象化を管理し、ワークロードがノード間で効率的に通信できるようにします。
  • GPUs: このプラグインは GPU デバイスの割り当てを処理し、マルチインスタンス GPU (MIG) デバイスの動的割り当てなどの機能を可能にします。

対象ユーザー

大規模な AI 学習や推論に特化した NVIDIA ハードウェアを管理する必要がある Kubernetes 管理者および AI インフラエンジニア向けに設計されています。特に NVIDIA GB200 システムを使用している場合や、マルチノード GPU 通信を必要とするユーザーに適しています。

主な特徴

  • マルチノード NVLink 対応: 異なるノード間のポッド間で安全かつ堅牢な接続をオーケストレーションします。
  • 動的リソース割り当て: Kubernetes DRA フレームワークを活用し、リソース構成をサードパーティベンダーに委ねます。
  • 柔軟な GPU 共有: 同じポッド内の複数のコンテナ間で1つの GPU を共有できます。
  • 一時的な ComputeDomains: 消費ワークロードのライフタイム中にのみ存在する隔離された通信ドメインを生成します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト