Tracer-Cloud/opensre
Build your own AI SRE agents. The open source toolkit for the AI era.
解決的問題
OpenSRE 提供了一個構建 AI 站點可靠性工程 (SRE) 代理的框架,該代理可以自動調查並解決生產事故。透過為代理事故響應與訓練提供標準化環境,解決了分散式故障除錯難的問題(證據通常分散在日誌、指標與追蹤中)。
工作原理
當警報觸發時,系統遵循結構化流程:
- 上下文收集:獲取相關的日誌、指標、追蹤與部署歷史。
- 隱私保護:在將數據發送到 LLM 之前,可選擇性地對敏感識別碼進行遮蔽。
- 推理:代理使用工具調用循環在連接的系統中測試假設。
- 報告:生成結構化的調查報告,透過關聯證據識別可能的根本原因。
- 修復:建議或執行解決問題的後續步驟。
- 通知:將摘要發布到 Slack 或 Telegram 等通訊工具。
適用對象
此工具專為希望使用 AI 代理實現生產除錯與根本原因分析 (RCA) 自動化的 SRE、DevOps 工程師與開發人員設計。
亮點
- 廣泛的集成:連接超過 60 種工具,涵蓋可觀測性 (Grafana, Datadog, Sentry)、基礎設施 (Kubernetes, AWS, GCP) 與資料庫 (PostgreSQL, MongoDB)。
- 訓練與評估:包含合成事故模擬與端到端測試,用於基準測試並提升代理效能。
- 靈活的 LLM 支援:相容於包括 Anthropic, OpenAI, Gemini 以及透過 Ollama 運行的本地模型在內的各種供應商。
- Runbook 感知:代理在調查過程中可以自動讀取並應用現有的執行手冊 (Runbooks)。
相關
- 專案
- 專案
- 專案
- 專案
- 專案