NVIDIA/NVSentinel

NVSentinel detects and remediates GPU faults on Kubernetes nodes

解決的問題

NVSentinel 解決了在 Kubernetes 集群中維持 GPU 基礎設施可靠性的挑戰。它自動檢測並修復 GPU 節點的硬體與軟體故障,透過自動隔離與修復故障硬體,防止其影響 AI 工作負載。

工作原理

NVSentinel 採用微服務架構,將檢測與操作分離。

  1. 檢測:可插入的健康監控器(GPU、Syslog、雲端供應商、Kubernetes 物件監控器)檢測故障,並透過 gRPC 將事件傳送給平台連接器。
  2. 持久化:平台連接器驗證這些事件並儲存至 MongoDB 資料庫,同時更新 Kubernetes 節點狀態。
  3. 修復:獨立的核心模組監聽 MongoDB 的變更串流。根據故障類型,觸發特定動作:故障隔離模組將節點標記為不可調度,節點驅逐模組驅逐工作負載,故障修復模組建立維護 CRD 以觸發外部修復工作流程。

適用對象

專為在 Kubernetes 上管理大型 NVIDIA GPU 集群的平台工程師與叢集管理員設計,幫助他們自動化 GPU 健康管理,減少硬體故障時的手動介入。

主要亮點

  • 全自動生命週期管理:從故障檢測到節點隔離、工作負載驅逐,再到觸發修復,全流程自動化。
  • 輕量級整合:健康監控器使用 gRPC 接口,模組間非同步協調透過 MongoDB 變更串流實現。
  • 廣泛的 GPU 支援:已在 Hopper、Ampere、Blackwell 和 Ada Lovelace 等多個 NVIDIA 架構上驗證通過。
  • 可擴展設計:透過模組化架構支援自訂健康監控器與驅逐插件。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案