NVIDIA/NVSentinel
NVSentinel detects and remediates GPU faults on Kubernetes nodes
何を解決するか
NVSentinelはKubernetesクラスタにおけるGPUインフラの信頼性を維持する課題に対処します。GPUノードのハードウェアおよびソフトウェア障害の検出と修復を自動化し、障害のあるハードウェアがAIワークロードに影響を与えないように、自動的に隔離・修復します。
動作方法
NVSentinelは、検出とアクションを分離したマイクロサービスアーキテクチャを使用しています。
- 検出: 拡張可能なヘルスモニタ(GPU、Syslog、クラウドプロバイダ、Kubernetesオブジェクトモニタ)が障害を検出し、gRPC経由でプラットフォームコネクタにイベントを送信します。
- 永続化: プラットフォームコネクタはこれらのイベントを検証し、MongoDBデータベースに保存するとともに、Kubernetesノードの状態を更新します。
- 修復: 独立したコアモジュールがMongoDBの変更ストリームを監視します。障害の種類に応じて、特定のアクションをトリガーします:Fault Quarantineモジュールがノードを隔離し、Node Drainerがワークロードを排出し、Fault RemediationモジュールがメンテナンスCRDを作成して外部の修復ワークフローを開始します。
対象ユーザー
大規模なNVIDIA GPUクラスタをKubernetes上で管理するプラットフォームエンジニアおよびクラスタ管理者向けです。ハードウェア障害時の手動介入を減らし、GPUの健全性管理を自動化したい方におすすめです。
特徴
- 自動化されたライフサイクル: 障害検出からノードの隔離、ワークロードの排出、修復の開始までを一貫して処理します。
- 軽量な統合: ヘルスモニタにはgRPCインターフェース、モジュール間の非同期連携にはMongoDBの変更ストリームを使用します。
- 広範なGPU対応: Hopper、Ampere、Blackwell、Ada Lovelaceを含む複数のNVIDIAアーキテクチャで検証済みです。
- 拡張性のある設計: モジュールアーキテクチャにより、カスタムヘルスモニタやドレインプラグインの追加が可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト