NVIDIA/NVSentinel

NVSentinel detects and remediates GPU faults on Kubernetes nodes

解决的问题

NVSentinel 解决了在 Kubernetes 集群中维护 GPU 基础设施可靠性的挑战。它自动检测并修复 GPU 节点的硬件和软件故障,通过自动隔离和修复故障硬件,防止其影响 AI 工作负载。

工作原理

NVSentinel 采用微服务架构,将检测与操作分离。

  1. 检测:可插拔的健康监控器(GPU、Syslog、云提供商、Kubernetes 对象监控器)检测故障,并通过 gRPC 将事件发送给平台连接器。
  2. 持久化:平台连接器验证这些事件并将其存储在 MongoDB 数据库中,同时更新 Kubernetes 节点状态。
  3. 修复:独立的核心模块监听 MongoDB 的变更流。根据故障类型,触发特定操作:故障隔离模块将节点标记为不可调度,节点驱逐模块驱逐工作负载,故障修复模块创建维护 CRD 以触发外部修复工作流。

适用人群

专为在 Kubernetes 上管理大规模 NVIDIA GPU 集群的平台工程师和集群管理员设计,帮助他们自动化 GPU 健康管理,减少硬件故障时的手动干预。

主要亮点

  • 全自动生命周期管理:从故障检测到节点隔离、工作负载驱逐,再到触发修复,全流程自动化。
  • 轻量级集成:健康监控器使用 gRPC 接口,模块间异步协调通过 MongoDB 变更流实现。
  • 广泛的 GPU 支持:已在 Hopper、Ampere、Blackwell 和 Ada Lovelace 等多个 NVIDIA 架构上验证通过。
  • 可扩展设计:通过模块化架构支持自定义健康监控器和驱逐插件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目