ROCm/k8s-device-plugin
Kubernetes (k8s) device plugin to enable registration of AMD GPU to a container cluster
解決的問題
此專案提供 Kubernetes 集群識別並使用 AMD GPU 的方式。若無設備插件,Kubernetes 無法原生排程需要 AMD GPU 特定硬體加速的計算工作負載。
作法
它實作了 Kubernetes 設備插件介面,讓 AMD GPU 可註冊為容器叢集中的可排程資源。通常以 DaemonSet 形式部署於所有配備 AMD GPU 的節點上,確保硬體對叢集排程器可見。也可與 AMD GPU Operator 整合,實現更廣泛的資源管理。
適用對象
管理使用 AMD 硬體進行計算密集型任務(如機器學習或高效能運算)的 Kubernetes 叢集的系統管理員與 DevOps 工程師。
主要特色
- Kubernetes 整合:讓 AMD GPU 可作為標準可排程資源使用。
- 健康監控:透過 gRPC 套接字服務支援實驗性的 GPU 級細粒度健康檢測。
- 彈性部署:可透過標準 YAML 清單或 Helm Chart 部署。
- 節點標籤:包含一個節點標籤工具,用於向叢集節點新增額外的 GPU 屬性。
相關
- 專案
- 專案
- 專案
- 專案
- 專案