leptonai/gpud
GPUd automates monitoring, diagnostics, and issue identification for GPUs
何を解決するか
GPUdは、大規模なAI/MLクラスタにおけるGPUの効率性と信頼性を維持する課題に対処します。GPUの健全性を積極的に監視し、ワークロードを管理することで、ハードウェアが最適に動作していることを保証し、本番環境でのダウンタイムを防止します。
動作方法
GPUdはLinuxマシン上で軽量で自己完結型のバイナリとして実行されます。NVIDIAエコシステム(NVMLおよびDCGMを含む)およびDocker、containerd、Kubernetesなどのシステムツールと統合され、重要なメトリクスを収集・報告します。GPUの電力、温度、ファブリック状態を監視し、ハードウェアの遅延、kmsgエラー、NVML Xidイベントをスキャンして、ワークロードに影響を与える前に障害を検出します。
対象ユーザー
AI/MLワークロード用のGPUクラスタを管理するエンジニアおよびオペレーター向けです。特に、本番環境でNVIDIAハードウェアを使用している場合や、DGX Cloud Leptonと統合している場合に適しています。
主な特徴
- GPU中心の監視: クリティカルなGPUおよびGPUファブリックメトリクスを統合的に表示します。
- 本番環境での検証済み: DGX Cloud Leptonの本番インフラで使用されています。
- 低オーバーヘッド: ワークロードの重要なパスから監視を外すように設計されており、CPUおよびメモリ使用量を最小限に抑えます。
- 柔軟なデプロイ: systemdによるホスト直接インストール、フォアグラウンド/バックグラウンド実行、HelmチャートによるKubernetesデプロイをサポートしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト