VersusControl/versus-incident
Versus Incident is the self-hosted AI SRE agent. It learns what your system normally look like and escalates only what is new or unexpected issues — routing to your chat channels and on-call platform.
解決的問題
Versus Incident 是一個自托管的 AI SRE 代理,旨在透過自動檢測日誌中的異常來減少告警疲勞,而無需手動設定告警規則。它防止已知模式的雜訊傳達給工程師,僅將新出現或意外的問題升級至聊天頻道和值班平台。
工作原理
該系統透過兩種主要輸入方式運作:
- AI SRE 代理:此代理從檔案或 Elasticsearch 等來源讀取日誌。它使用「訓練」模式學習正常日誌模式,並使用「檢測」模式識別全新的錯誤或異常。當發現新模式時,AI SRE 會進行事件分類,產生摘要、嚴重程度與建議的下一步操作。
- Webhook 告警:它作為現有監控工具(如 Prometheus Alertmanager、Grafana、Sentry、CloudWatch SNS)的中央樞紐,透過 JSON POST 請求接收告警,並透過相同的通知管道進行路由。
一旦觸發事件,將透過 Go 模板格式化,並分發至多個渠道(Slack、Teams、Telegram 等),若未在規定時間內被確認,則會升級至值班平台(PagerDuty、AWS Incident Manager)。
適用對象
希望自動化基於日誌的異常檢測,並集中管理事件通知與升級流程的 DevOps 與網站可靠性工程師(SRE)。
主要亮點
- 零規則異常檢測:自動學習「正常」日誌模式,僅在出現新問題時觸發告警。
- 多階段部署:包含
training、shadow和detect模式,可在上線前驗證 AI 判斷。 - 廣泛整合:支援多種通知渠道(Slack、Teams、Telegram、Viber、Email、Lark)與值班平台。
- 靈活過濾:使用正則表達式預過濾器,在 AI 處理日誌前丟棄無聊的雜訊(如 200-OK 回應)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案