HolmesGPT/holmesgpt
SRE Agent - CNCF Sandbox Project
解决的问题
HolmesGPT 是一款旨在自动执行生产故障调查和识别根本原因的 AI Agent。通过查询包括 Kubernetes、VM、云提供商和数据库在内的各种基础设施栈的实时观测数据,消除手动排障的需要。
工作原理
它采用代理循环(agentic loop)与各种数据源(工具集)进行交互以收集证据。它可以运行在交互模式下进行人工主导的调查,或者运行在“Operator 模式”下,在后台 24/7 全天候运行以发现问题并通过 Slack 向用户发送警报。它集成了广泛的 LLM 提供商(OpenAI、Anthropic、Gemini 等),并可以从 PagerDuty 或 Jira 等系统获取警报并将调查结果写回其中。
适用对象
管理复杂的多云或混合基础设施,并需要减少根本原因分析耗时的人员,如站点可靠性工程师 (SRE) 和 DevOps 工程师。
亮点
- 广泛的集成生态系统:内置了 Prometheus、Grafana、Datadog、Kubernetes、AWS、Azure、GCP 等工具集。
- 大规模数据处理:使用服务端过滤和 JSON 树遍历来处理 PB 级数据,而不会导致 LLM 上下文窗口溢出。
- 内存安全性:实施了针对每个工具的内存限制和输出预算,以防止在查询大型数据集时发生 OOM(内存溢出)。
- 自动化修复:使用 GitHub 集成时,可以提交 GitHub PR 来修复识别出的问题。
- 基础设施无关:适用于 VM、裸机和容器;运行 Agent 本身并不需要 Kubernetes。
相关
- 项目
- 项目
- 项目
- 项目
- 项目