ongridio/ongrid

An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.

何を解決するか

Ongridは、インフラストラクチャの問題の調査と解決を自動化するために設計されたAI搭載のオペレーションエージェントです。メトリクス、ログ、トレースをシステムのトポロジー全体で相関させることで、障害の正確なソースを特定し、多くの場合、特定のコード行まで特定することで、根本原因分析(RCA)の手作業による労力を排除します。

仕組み

Ongridは、タスクを専門エージェント(SRE、ネットワーク、またはデータベースエージェントなど)に割り当てるコーディネーターで構成される階層型エージェントシステムを使用します。オブザーバビリティスタック(Prometheus, Loki, Tempo, Grafana)と統合し、RAGベースの知識検索を使用してランブックやインシデント履歴をインデックス化します。システムは、アラートやSlackまたはTelegramのようなチャットインターフェースを介したユーザーのクエリによってトリガーされることができ、本番環境への変更が行われる前に人間の承認を必要とする「write gate」が含まれています。

対象者

Kubernetesクラスターやネットワークデバイスを含む複雑なインフラストラクチャを管理し、自動調査を通じて平均復旧時間(MTTR)を短縮したいSRE、DevOpsエンジニア、およびプラットフォームオペレーター向けに構築されています。

ハイライト

  • 自動根本原因分析: オブザーバビリティデータとトポロジーを相関させて、アラートの背後にある「理由」を特定します。
  • マルチエージェントアーキテクチャ: コーディネーターと専門エージェントを使用して、異なるインフラストラクチャドメインを処理します。
  • チャットへの引き継ぎ: Slack、Telegram、およびその他のIMチャネル内で直接動作します。
  • セキュアなアクセス: リバーストンネリングを備えたブラウザベースのSSHシェル機能を備えており、ホストへのインバウンドポートを必要としません。
  • 拡張可能なツール: MCPサーバーと、新しい運用ツールを追加するためのカスタムスキルカタログをサポートしています。
  • Kubernetes管理: クラスターの登録、ワークロードの検査、およびライフサイクルアップグレードを処理します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト