utkuozdemir/nvidia_gpu_exporter
Nvidia GPU exporter for prometheus using nvidia-smi binary
解決的問題
它提供了一種在不同的作業系統和硬體配置下監控 NVIDIA GPU 的方法,而無需複雜的 datacenter 工具或 NVIDIA GPU Operator 堆疊。對於通常無法取得深度 GPU 計數器的消費級 GPU (GeForce/RTX)、小型 Kubernetes 叢集、邊緣盒以及虛擬化環境,它特別有用。
工作原理
該匯出器透過解析 nvidia-smi 二進位檔案的輸出來收集指標。它還可以選擇直接從 NVIDIA Management Library (NVML) 讀取指標,以獲取更進階的數據,例如 XID 錯誤計數器和每個 MIG 實例的指標。收集到的數據以與 Prometheus 相容的格式匯出,並可以使用提供的 Grafana 儀表板進行視覺化。
適用對象
- 管理混合 NVIDIA GPU 艦隊的系統管理員和開發人員。
- 希望在儀表板上追蹤 GPU 統計數據的 Homelab 愛好者和遊戲玩家。
- 在 Windows、Linux 或 MacOS 上執行 GPU 並需要輕量級單一二進位匯出器的使用者。
- 小型 Kubernetes 叢集或邊緣裝置的營運者。
亮點
- 跨平台支援:只要存在
nvidia-smi,即可在 Windows、Linux 和 MacOS 上執行。 - 遠端執行:可以配置為在遠端機器上執行
nvidia-smi。 - 靈活的採集:支援定時背景採集,以避免 scraping 開銷。
- 自動發現:自動偵測
nvidia-smi暴露的指標欄位,以實現未來的相容性。 - 進程級監控:可以追蹤哪些特定進程正在消耗 GPU 記憶體。
- 內建視覺化:包含用於單個 GPU 詳情和多 GPU 概覽的官方 Grafana 儀表板。