NVIDIA/NVSentinel

NVSentinel detects and remediates GPU faults on Kubernetes nodes

何を解決するか

NVSentinelはKubernetesクラスタにおけるGPUインフラの信頼性を維持する課題に対処します。GPUノードのハードウェアおよびソフトウェア障害の検出と修復を自動化し、障害のあるハードウェアがAIワークロードに影響を与えないように、自動的に隔離・修復します。

動作方法

NVSentinelは、検出とアクションを分離したマイクロサービスアーキテクチャを使用しています。

  1. 検出: 拡張可能なヘルスモニタ(GPU、Syslog、クラウドプロバイダ、Kubernetesオブジェクトモニタ)が障害を検出し、gRPC経由でプラットフォームコネクタにイベントを送信します。
  2. 永続化: プラットフォームコネクタはこれらのイベントを検証し、MongoDBデータベースに保存するとともに、Kubernetesノードの状態を更新します。
  3. 修復: 独立したコアモジュールがMongoDBの変更ストリームを監視します。障害の種類に応じて、特定のアクションをトリガーします:Fault Quarantineモジュールがノードを隔離し、Node Drainerがワークロードを排出し、Fault RemediationモジュールがメンテナンスCRDを作成して外部の修復ワークフローを開始します。

対象ユーザー

大規模なNVIDIA GPUクラスタをKubernetes上で管理するプラットフォームエンジニアおよびクラスタ管理者向けです。ハードウェア障害時の手動介入を減らし、GPUの健全性管理を自動化したい方におすすめです。

特徴

  • 自動化されたライフサイクル: 障害検出からノードの隔離、ワークロードの排出、修復の開始までを一貫して処理します。
  • 軽量な統合: ヘルスモニタにはgRPCインターフェース、モジュール間の非同期連携にはMongoDBの変更ストリームを使用します。
  • 広範なGPU対応: Hopper、Ampere、Blackwell、Ada Lovelaceを含む複数のNVIDIAアーキテクチャで検証済みです。
  • 拡張性のある設計: モジュールアーキテクチャにより、カスタムヘルスモニタやドレインプラグインの追加が可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト