HolmesGPT/holmesgpt

SRE Agent - CNCF Sandbox Project

What it solves

HolmesGPT 是一个 AI 代理,旨在自动化生产事故的调查与根因识别。它减少了站点可靠性工程师(SRE)在各种基础设施栈中筛选日志、指标和警报所需的手动工作量。

How it works

它使用代理循环从各种来源查询实时可观测性数据。它可与 Prometheus、Grafana、Datadog、Kubernetes 以及各大云服务提供商(AWS、Azure、GCP)集成。代理能够从 PagerDuty 或 Jira 等系统获取警报、分析数据,并将结果写回 Slack 或原始工单。

此外,它具备“Operator Mode”,可在后台 24/7 运行,主动发现问题并通过 Slack 通知用户,甚至可以打开 GitHub PR 来应用修复。

Who it’s for

此工具主要面向管理包含 Kubernetes、虚拟机、云服务和 SaaS 平台的复杂生产环境的 SRE 与 DevOps 工程师。

Highlights

  • Broad Integration Ecosystem:支持大量数据源,包括主要云服务提供商、数据库和可观测性工具。
  • Scale-Aware Data Handling:使用服务器端过滤和输出预算,处理 PB 级数据而不超出 LLM 上下文窗口。
  • Memory-Safe Execution:实现每个工具的内存限制与磁盘流式写入,防止大查询时 OOM 被杀。
  • LLM Agnostic:兼容多种提供商,包括 OpenAI、Anthropic、Azure、Bedrock 与 Gemini。
  • Read-Only Safety:以只读访问和 RBAC 为前提设计,确保安全的生产部署。