VersusControl/versus-incident
Versus Incident is the self-hosted AI SRE agent. It learns what your system normally look like and escalates only what is new or unexpected issues — routing to your chat channels and on-call platform.
何を解決するか
Versus Incident は、手動のアラートルールを必要とせずにログ内の異常を自動検出する、自己ホスト型のAI SREエージェントです。既知のパターンのノイズがエンジニアに届くのを防ぎ、新規または予期しない問題のみをチャットチャンネルやオンコールプラットフォームにエスカレートします。
動作方法
このシステムは2つの主要な入力方法で動作します:
- AI SREエージェント:このエージェントは、ファイルやElasticsearchなどのソースからログを読み取ります。"トレーニング"モードで正常なログパターンを学習し、"検出"モードで新しいエラーまたは異常を特定します。新しいパターンが検出されると、AI SREがイベントをトリアージし、要約、深刻度レベル、および推奨される次のステップを生成します。
- Webhookアラート:Prometheus Alertmanager、Grafana、Sentry、CloudWatch SNSなどの既存のモニタリングツールの中央ハブとして機能します。JSON POSTリクエストでアラートを受け取り、同じ通知パイプラインを通じてルーティングします。
インシデントが発生すると、Goテンプレートでフォーマットされ、複数のチャネル(Slack、Teams、Telegramなど)に配信され、タイムリーに認識されない場合はオンコールプロバイダー(PagerDuty、AWS Incident Manager)にエスカレートされます。
対象ユーザー
ログベースの異常検出を自動化し、インシデント通知とエスカレーションワークフローを統合したいDevOpsおよびサイト信頼性エンジニア(SRE)。
特徴
- ルールゼロの異常検出:自動的に「正常」なログパターンを学習し、新規の問題のみでアラートを発動します。
- 多段階デプロイ:
training、shadow、detectモードを含み、本番稼働前にAIの判断を検証できます。 - 広範な統合:Slack、Teams、Telegram、Viber、Email、Larkなど、多数の通知チャネルとオンコールプラットフォームをサポートします。
- 柔軟なフィルタリング:AIがログを処理する前に、正規表現によるプリフィルタで退屈なノイズ(例:200-OK応答)を除外できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト