robusta-dev/robusta
Better Prometheus alerts for Kubernetes - smart grouping, AI enrichment, and automatic remediation
解决的问题
Robusta 减少了与 Kubernetes 监控相关的噪音和手动工作。它通过为 Prometheus 警报丰富关键诊断数据(如 Pod 日志)并提供自动修复路径,解决了“警报疲劳”问题,使工程师无需手动寻找故障原因。
工作原理
Robusta 通过 Webhook 与 Prometheus 集成。当触发警报时,Robusta 使用一套规则和可选的 AI 自动收集相关信息(如日志、图表和资源变更),并将这些数据附加到发送到 Slack、Teams 或 Jira 等平台的通知中。
适用对象
专为使用 Prometheus 进行监控并希望实现事件响应工作流自动化的 Kubernetes 集群运维人员(DevOps)和站点可靠性工程师(SRE)设计。
亮点
- 警报增强:自动将 Pod 日志和其他诊断数据附加到警报中。
- 自愈功能:允许用户定义自动修复规则以自动解决常见问题。
- 智能分组:通过将相关警报分组到 Slack 线程中,减少通知骚扰。
- Kubernetes 原生警报:无需复杂的 PromQL 即可为 OOMKills 和失败的 Job 等事件生成警报。
- 变更追踪:将警报与 Kubernetes 资源的近期变更进行关联,以识别潜在原因。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch