NVIDIA/NVSentinel
NVSentinel detects and remediates GPU faults on Kubernetes nodes
解決的問題
NVSentinel 解決了在 Kubernetes 集群中維持 GPU 基礎設施可靠性的挑戰。它自動檢測並修復 GPU 節點的硬體與軟體故障,透過自動隔離與修復故障硬體,防止其影響 AI 工作負載。
工作原理
NVSentinel 採用微服務架構,將檢測與操作分離。
- 檢測:可插入的健康監控器(GPU、Syslog、雲端供應商、Kubernetes 物件監控器)檢測故障,並透過 gRPC 將事件傳送給平台連接器。
- 持久化:平台連接器驗證這些事件並儲存至 MongoDB 資料庫,同時更新 Kubernetes 節點狀態。
- 修復:獨立的核心模組監聽 MongoDB 的變更串流。根據故障類型,觸發特定動作:故障隔離模組將節點標記為不可調度,節點驅逐模組驅逐工作負載,故障修復模組建立維護 CRD 以觸發外部修復工作流程。
適用對象
專為在 Kubernetes 上管理大型 NVIDIA GPU 集群的平台工程師與叢集管理員設計,幫助他們自動化 GPU 健康管理,減少硬體故障時的手動介入。
主要亮點
- 全自動生命週期管理:從故障檢測到節點隔離、工作負載驅逐,再到觸發修復,全流程自動化。
- 輕量級整合:健康監控器使用 gRPC 接口,模組間非同步協調透過 MongoDB 變更串流實現。
- 廣泛的 GPU 支援:已在 Hopper、Ampere、Blackwell 和 Ada Lovelace 等多個 NVIDIA 架構上驗證通過。
- 可擴展設計:透過模組化架構支援自訂健康監控器與驅逐插件。
相關
- 專案
- 專案
- 專案
- 專案
- 專案