ongridio/ongrid

An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.

解決的問題

Ongrid 是一款專為自動化基礎設施故障調查與解決而設計的 AI 驅動維運代理。它透過關聯系統拓撲結構中的指標、日誌與追蹤數據,減少 SRE 與維運人員尋找根本原因所需的手動工作。

工作原理

該系統使用協調代理將任務分發給專家代理(如 SRE、網路或資料庫代理)。它與可觀測性技術棧(Prometheus, Loki, Tempo, Grafana)整合以收集證據,並透過遍歷拓撲結構將問題定位到特定的原始碼行來執行根本原因分析 (RCA)。它透過 Slack 或 Telegram 等聊天介面運行,並包含一個用於人工核准高風險生產環境變更的「寫入閘門 (write gate)」。

適用對象

需要在複雜的分散式系統中實現故障響應與根本原因分析自動化的基礎設施工程師、網站可靠性工程師 (SRE) 與 DevOps 團隊。

亮點

  • 多代理架構:使用協調者與專家代理進行針對性的故障排除。
  • 自動調查:收到警報後自動啟動 RCA 工作人員。
  • RAG 知識庫:索引運行手冊、故障歷史紀錄與程式碼庫以獲取維運上下文。
  • 安全存取:具有基於瀏覽器的 SSH 反向隧道 Shell,無需入站連接埠或跳板機。
  • 模型無關:支援包括 Anthropic, OpenAI, DeepSeek 與 Gemini 在內的各種 LLM。
  • 支援 MCP 伺服器:允許註冊外部模型上下文協定 (MCP) 伺服器以擴展代理能力。