HolmesGPT/holmesgpt

SRE Agent - CNCF Sandbox Project

What it solves

HolmesGPT 是一個 AI 代理,旨在自動化生產事故的調查與根因辨識。它減少了站點可靠性工程師(SRE)在各種基礎設施堆疊中篩選日誌、指標與警報所需的手動工作量。

How it works

它使用代理迴圈向各種來源查詢即時可觀測性資料。它可與 Prometheus、Grafana、Datadog、Kubernetes 以及各大雲服務提供商(AWS、Azure、GCP)整合。代理能從 PagerDuty 或 Jira 等系統取得警報、分析資料,並將結果寫回 Slack 或原始工單。

此外,它具備「Operator Mode」可於背景 24/7 運行,主動偵測問題並透過 Slack 通知使用者,甚至可開啟 GitHub PR 以套用修復。

Who it’s for

此工具主要針對管理包含 Kubernetes、VM、雲端服務與 SaaS 平台的複雜生產環境的 SRE 與 DevOps 工程師。

Highlights

  • Broad Integration Ecosystem:支援大量資料來源,包括主要雲服務提供商、資料庫與可觀測性工具。
  • Scale-Aware Data Handling:使用伺服器端過濾與輸出預算,處理 PB 級資料而不會超出 LLM 上下文窗口。
  • Memory-Safe Execution:實作每個工具的記憶體限制與磁碟串流,防止大型查詢時 OOM 被殺。
  • LLM Agnostic:相容多種提供商,包括 OpenAI、Anthropic、Azure、Bedrock 與 Gemini。
  • Read-Only Safety:以唯讀存取與 RBAC 為前提設計,確保安全的生產部署。