robusta-dev/robusta

Better Prometheus alerts for Kubernetes - smart grouping, AI enrichment, and automatic remediation

解決的問題

Robusta 減少了與 Kubernetes 監控相關的噪音和手動工作。它透過為 Prometheus 警報豐富關鍵診斷數據(如 Pod 日誌)並提供自動修復路徑,解決了「警報疲勞」問題,讓工程師無需手動尋找故障原因。

工作原理

Robusta 透過 Webhook 與 Prometheus 集成。當觸發警報時,Robusta 使用一套規則和選配的 AI 自動收集相關資訊(如日誌、圖表和資源變更),並將這些數據附加到發送到 Slack、Teams 或 Jira 等平台的通知中。

適用對象

專為使用 Prometheus 進行監控並希望實現事件響應工作流自動化的 Kubernetes 集群維運人員(DevOps)和網站可靠性工程師(SRE)設計。

亮點

  • 警報增強:自動將 Pod 日誌和其他診斷數據附加到警報中。
  • 自我修復:允許使用者定義自動修復規則以自動解決常見問題。
  • 智慧分組:透過將相關警報分組到 Slack 執行緒中,減少通知騷擾。
  • Kubernetes 原生警報:無需複雜的 PromQL 即可為 OOMKills 和失敗的 Job 等事件生成警報。
  • 變更追蹤:將警報與 Kubernetes 資源的近期變更進行關聯,以識別潛在原因。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch