ongridio/ongrid

An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.

解決する課題

Ongridは、インフラのインシデント調査と解決を自動化するために設計されたAI駆動のオペレーションエージェントです。システムのトポロジー全体にわたってメトリクス、ログ、トレースを相関させることで、SREやオペレーターが根本原因を特定するために必要な手作業を削減します。

仕組み

このシステムは、タスクを専門エージェント(SRE、ネットワーク、データベースエージェントなど)に割り当てるコーディネーターエージェントを使用します。オブザーバビリティスタック(Prometheus, Loki, Tempo, Grafana)と統合して証拠を収集し、トポロジーを辿って問題を特定のソースコード行に紐付けることで、根本原因分析(RCA)を実行できます。SlackやTelegramなどのチャットインターフェースを介して動作し、リスクのある本番環境の変更に対して人間の承認を求める「ライトゲート(write gate)」を備えています。

対象者

複雑な分散システムにおいて、インシデント対応と根本原因分析の自動化を必要とするインフラエンジニア、サイト信頼性エンジニア(SRE)、およびDevOpsチーム。

ハイライト

  • マルチエージェントアーキテクチャ: コーディネーターと専門エージェントを使用して、的を絞ったトラブルシューティングを行います。
  • 自動調査: アラートを受信すると、自動的にRCAワーカーを起動します。
  • RAGナレッジベース: 運用コンテキストのために、ランブック、インシデント履歴、コードリポジトリをインデックス化します。
  • セキュアなアクセス: インバウンドポートやジャンプボックスを必要としない、ブラウザベースのSSHリバーストンネルシェルを備えています。
  • モデル非依存: Anthropic, OpenAI, DeepSeek, Geminiを含む様々なLLMをサポートしています。
  • MCPサーバーサポート: 外部のModel Context Protocol (MCP) サーバーの登録を許可し、エージェントの機能を拡張できます。