NVIDIA/DCGM
NVIDIA Data Center GPU Manager (DCGM) is a project for gathering telemetry and measuring the health of NVIDIA GPUs
何を解決するか
NVIDIA Data Center GPU Manager (DCGM) は、大規模なクラスタ環境におけるNVIDIA GPUの管理と監視の複雑さに対処します。信頼性と稼働率を確保するために、集中管理された方法でGPUの健全性監視、診断、リソースガバナンスを提供します。
動作方法
DCGMは、テレメトリを収集しGPUの状態を管理するデーモンとして動作します。アクティブな健全性監視と包括的な診断を提供するツールセットを備えています。インフラチーム向けのスタンドアロンツールとして使用できるほか、より大きなクラスタ管理およびリソーススケジューリングシステムに統合することも可能です。また、dcgm-exporter を通じてKubernetesエコシステムとも統合され、GPUのテレメトリを収集できます。
対象ユーザー
データセンターにおけるNVIDIA GPUクラスタを管理するインフラチームやシステム管理者、およびクラスタ管理ツールを開発する開発者。
主な特徴
- 包括的な監視: アクティブな健全性監視とシステムアラートを含む。
- ガバナンスポリシー: GPUの電力およびクロック設定を管理。
- 診断機能: GPU健全性を検証するためのツールセットを提供。
- 広範なプラットフォーム対応: x86_64、Arm、POWER (ppc64le) アーキテクチャのLinuxをサポート。
- APIサポート: C、Python、Goでのライブラリおよびソース例を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト