HolmesGPT/holmesgpt
SRE Agent - CNCF Sandbox Project
What it solves
HolmesGPT 是一个 AI 代理,旨在自动化生产事故的调查与根因识别。它减少了站点可靠性工程师(SRE)在各种基础设施栈中筛选日志、指标和警报所需的手动工作量。
How it works
它使用代理循环从各种来源查询实时可观测性数据。它可与 Prometheus、Grafana、Datadog、Kubernetes 以及各大云服务提供商(AWS、Azure、GCP)集成。代理能够从 PagerDuty 或 Jira 等系统获取警报、分析数据,并将结果写回 Slack 或原始工单。
此外,它具备“Operator Mode”,可在后台 24/7 运行,主动发现问题并通过 Slack 通知用户,甚至可以打开 GitHub PR 来应用修复。
Who it’s for
此工具主要面向管理包含 Kubernetes、虚拟机、云服务和 SaaS 平台的复杂生产环境的 SRE 与 DevOps 工程师。
Highlights
- Broad Integration Ecosystem:支持大量数据源,包括主要云服务提供商、数据库和可观测性工具。
- Scale-Aware Data Handling:使用服务器端过滤和输出预算,处理 PB 级数据而不超出 LLM 上下文窗口。
- Memory-Safe Execution:实现每个工具的内存限制与磁盘流式写入,防止大查询时 OOM 被杀。
- LLM Agnostic:兼容多种提供商,包括 OpenAI、Anthropic、Azure、Bedrock 与 Gemini。
- Read-Only Safety:以只读访问和 RBAC 为前提设计,确保安全的生产部署。