VersusControl/versus-incident

Versus Incident is the self-hosted AI SRE agent. It learns what your system normally look like and escalates only what is new or unexpected issues — routing to your chat channels and on-call platform.

何を解決するか

Versus Incident は、手動のアラートルールを必要とせずにログ内の異常を自動検出する、自己ホスト型のAI SREエージェントです。既知のパターンのノイズがエンジニアに届くのを防ぎ、新規または予期しない問題のみをチャットチャンネルやオンコールプラットフォームにエスカレートします。

動作方法

このシステムは2つの主要な入力方法で動作します:

  1. AI SREエージェント:このエージェントは、ファイルやElasticsearchなどのソースからログを読み取ります。"トレーニング"モードで正常なログパターンを学習し、"検出"モードで新しいエラーまたは異常を特定します。新しいパターンが検出されると、AI SREがイベントをトリアージし、要約、深刻度レベル、および推奨される次のステップを生成します。
  2. Webhookアラート:Prometheus Alertmanager、Grafana、Sentry、CloudWatch SNSなどの既存のモニタリングツールの中央ハブとして機能します。JSON POSTリクエストでアラートを受け取り、同じ通知パイプラインを通じてルーティングします。

インシデントが発生すると、Goテンプレートでフォーマットされ、複数のチャネル(Slack、Teams、Telegramなど)に配信され、タイムリーに認識されない場合はオンコールプロバイダー(PagerDuty、AWS Incident Manager)にエスカレートされます。

対象ユーザー

ログベースの異常検出を自動化し、インシデント通知とエスカレーションワークフローを統合したいDevOpsおよびサイト信頼性エンジニア(SRE)。

特徴

  • ルールゼロの異常検出:自動的に「正常」なログパターンを学習し、新規の問題のみでアラートを発動します。
  • 多段階デプロイtrainingshadowdetectモードを含み、本番稼働前にAIの判断を検証できます。
  • 広範な統合:Slack、Teams、Telegram、Viber、Email、Larkなど、多数の通知チャネルとオンコールプラットフォームをサポートします。
  • 柔軟なフィルタリング:AIがログを処理する前に、正規表現によるプリフィルタで退屈なノイズ(例:200-OK応答)を除外できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト