HolmesGPT/holmesgpt
SRE Agent - CNCF Sandbox Project
What it solves
HolmesGPT は、本番インシデントの調査と根本原因の特定を自動化するために設計された AI エージェントです。多様なインフラストラクチャスタックにまたがるログ、メトリクス、アラートを調べる際に、Site Reliability Engineer(SRE)が要する手作業を削減します。
How it works
エージェントはエージェントループを用いて、さまざまなソースからリアルタイムの可観測データを取得します。Prometheus、Grafana、Datadog、Kubernetes、そして主要クラウドプロバイダー(AWS、Azure、GCP)と統合できます。PagerDuty や Jira などのシステムからアラートを取得し、データを分析して結果を Slack や元のチケットに書き戻します。
さらに「Operator Mode」を備えており、バックグラウンドで 24 時間365日稼働し、問題を事前に検知して Slack でユーザーに通知し、場合によっては GitHub PR を作成して修正を適用することも可能です。
Who it’s for
このツールは、Kubernetes、VM、クラウドサービス、SaaS プラットフォームを含む複雑な本番環境を管理する SRE および DevOps エンジニア向けです。
Highlights
- Broad Integration Ecosystem:主要クラウドプロバイダー、データベース、可観測ツールなど、膨大なデータソースをサポート。
- Scale-Aware Data Handling:サーバーサイドでフィルタリングと出力予算管理を行い、ペタバイト規模のデータでも LLM のコンテキストウィンドウを超えません。
- Memory-Safe Execution:ツールごとにメモリ上限を設定し、ディスクへストリーミングすることで大規模クエリ時の OOM を防止。
- LLM Agnostic:OpenAI、Anthropic、Azure、Bedrock、Gemini など、さまざまなプロバイダーに対応。
- Read-Only Safety:読み取り専用アクセスと RBAC を尊重した設計で、安全な本番デプロイを実現。