VersusControl/versus-incident

Versus Incident is the self-hosted AI SRE agent. It learns what your system normally look like and escalates only what is new or unexpected issues — routing to your chat channels and on-call platform.

解决的问题

Versus Incident 是一个自托管的 AI SRE 代理,旨在通过自动检测日志中的异常来减少告警疲劳,而无需手动设置告警规则。它防止已知模式的噪音到达工程师,仅将新出现或意外的问题升级到聊天频道和值班平台。

工作原理

该系统通过两种主要输入方式运行:

  1. AI SRE 代理:此代理从文件或 Elasticsearch 等源读取日志。它使用「训练」模式学习正常日志模式,并使用「检测」模式识别全新的错误或异常。当发现新模式时,AI SRE 会进行事件分类,生成摘要、严重程度和建议的下一步操作。
  2. Webhook 告警:它作为现有监控工具(如 Prometheus Alertmanager、Grafana、Sentry、CloudWatch SNS)的中央枢纽,通过 JSON POST 请求接收告警,并通过相同的通知管道进行路由。

一旦触发事件,将通过 Go 模板格式化,并分发到多个渠道(Slack、Teams、Telegram 等),如果未在规定时间内被确认,则会升级到值班平台(PagerDuty、AWS Incident Manager)。

适用人群

希望自动化基于日志的异常检测,并集中管理事件通知和升级流程的 DevOps 和站点可靠性工程师(SRE)。

主要亮点

  • 零规则异常检测:自动学习「正常」日志模式,仅在出现新问题时触发告警。
  • 多阶段部署:包含 trainingshadowdetect 模式,可在上线前验证 AI 判断。
  • 广泛集成:支持多种通知渠道(Slack、Teams、Telegram、Viber、Email、Lark)和值班平台。
  • 灵活过滤:使用正则表达式预过滤器,在 AI 处理日志前丢弃无聊的噪音(如 200-OK 响应)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目