Tracer-Cloud/opensre

Build your own AI SRE agents. The open source toolkit for the AI era.

解決的問題

OpenSRE 提供了一個構建 AI 站點可靠性工程 (SRE) 代理的框架,該代理可以自動調查並解決生產事故。透過為代理事故響應與訓練提供標準化環境,解決了分散式故障除錯難的問題(證據通常分散在日誌、指標與追蹤中)。

工作原理

當警報觸發時,系統遵循結構化流程:

  1. 上下文收集:獲取相關的日誌、指標、追蹤與部署歷史。
  2. 隱私保護:在將數據發送到 LLM 之前,可選擇性地對敏感識別碼進行遮蔽。
  3. 推理:代理使用工具調用循環在連接的系統中測試假設。
  4. 報告:生成結構化的調查報告,透過關聯證據識別可能的根本原因。
  5. 修復:建議或執行解決問題的後續步驟。
  6. 通知:將摘要發布到 Slack 或 Telegram 等通訊工具。

適用對象

此工具專為希望使用 AI 代理實現生產除錯與根本原因分析 (RCA) 自動化的 SRE、DevOps 工程師與開發人員設計。

亮點

  • 廣泛的集成:連接超過 60 種工具,涵蓋可觀測性 (Grafana, Datadog, Sentry)、基礎設施 (Kubernetes, AWS, GCP) 與資料庫 (PostgreSQL, MongoDB)。
  • 訓練與評估:包含合成事故模擬與端到端測試,用於基準測試並提升代理效能。
  • 靈活的 LLM 支援:相容於包括 Anthropic, OpenAI, Gemini 以及透過 Ollama 運行的本地模型在內的各種供應商。
  • Runbook 感知:代理在調查過程中可以自動讀取並應用現有的執行手冊 (Runbooks)。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案