leptonai/gpud

GPUd automates monitoring, diagnostics, and issue identification for GPUs

何を解決するか

GPUdは、大規模なAI/MLクラスタにおけるGPUの効率性と信頼性を維持する課題に対処します。GPUの健全性を積極的に監視し、ワークロードを管理することで、ハードウェアが最適に動作していることを保証し、本番環境でのダウンタイムを防止します。

動作方法

GPUdはLinuxマシン上で軽量で自己完結型のバイナリとして実行されます。NVIDIAエコシステム(NVMLおよびDCGMを含む)およびDocker、containerd、Kubernetesなどのシステムツールと統合され、重要なメトリクスを収集・報告します。GPUの電力、温度、ファブリック状態を監視し、ハードウェアの遅延、kmsgエラー、NVML Xidイベントをスキャンして、ワークロードに影響を与える前に障害を検出します。

対象ユーザー

AI/MLワークロード用のGPUクラスタを管理するエンジニアおよびオペレーター向けです。特に、本番環境でNVIDIAハードウェアを使用している場合や、DGX Cloud Leptonと統合している場合に適しています。

主な特徴

  • GPU中心の監視: クリティカルなGPUおよびGPUファブリックメトリクスを統合的に表示します。
  • 本番環境での検証済み: DGX Cloud Leptonの本番インフラで使用されています。
  • 低オーバーヘッド: ワークロードの重要なパスから監視を外すように設計されており、CPUおよびメモリ使用量を最小限に抑えます。
  • 柔軟なデプロイ: systemdによるホスト直接インストール、フォアグラウンド/バックグラウンド実行、HelmチャートによるKubernetesデプロイをサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト