VersusControl/versus-incident

Versus Incident is the self-hosted AI SRE agent. It learns what your system normally look like and escalates only what is new or unexpected issues — routing to your chat channels and on-call platform.

해결하는 문제

Versus Incident은 수동적인 알림 규칙 없이 로그 내 이상을 자동으로 탐지하도록 설계된 자체 호스팅 AI SRE 에이전트입니다. 알려진 패턴의 노이즈는 엔지니어에게 전달되지 않으며, 새로운 또는 예상치 못한 문제만 채팅 채널과 온콜 플랫폼으로 에스컬레이션됩니다.

작동 방식

시스템은 두 가지 주요 입력 방식을 통해 작동합니다:

  1. AI SRE 에이전트: 이 에이전트는 파일이나 Elasticsearch와 같은 소스에서 로그를 읽습니다. "학습" 모드에서는 정상적인 로그 패턴을 학습하고, "탐지" 모드에서는 완전히 새로운 오류나 이상을 식별합니다. 새로운 패턴이 발견되면 AI SRE가 이벤트를 트리아주며 요약, 심각도 수준, 그리고 제안되는 다음 단계를 생성합니다.
  2. Webhook 알림: Prometheus Alertmanager, Grafana, Sentry, CloudWatch SNS와 같은 기존 모니터링 도구의 중앙 허브로 작동합니다. JSON POST 요청을 통해 알림을 수신하고 동일한 알림 파이프라인을 통해 라우팅합니다.

인시던트가 발생하면 Go 템플릿을 통해 포맷되고 여러 채널(Slack, Teams, Telegram 등)로 확산되며, 지정된 시간 내에 인식되지 않으면 온콜 제공자(PagerDuty, AWS Incident Manager)로 에스컬레이션됩니다.

대상 사용자

로그 기반의 이상 탐지 자동화와 인시던트 알림 및 에스컬레이션 워크플로우를 통합하고자 하는 DevOps 및 사이트 신뢰성 엔지니어(SRE).

주요 특징

  • 규칙 없이 이상 탐지: "정상" 로그 패턴을 자동으로 학습하여 새로운 문제에서만 알림을 트리거합니다.
  • 다단계 배포: training, shadow, detect 모드를 포함하여 AI 판단을 본격 운영 전에 검증할 수 있습니다.
  • 광범위한 통합: Slack, Teams, Telegram, Viber, Email, Lark 등 다양한 알림 채널과 온콜 플랫폼을 지원합니다.
  • 유연한 필터링: AI가 로그를 처리하기 전에 정규식 프리필터를 사용해 지루한 노이즈(예: 200-OK 응답)를 제거할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트