ongridio/ongrid
An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.
解決的問題
Ongrid 是一個由 AI 驅動的運營代理,旨在自動化基礎設施問題的調查與修復。它透過跨系統架構相關聯的指標、日誌與追蹤資料,消除手動進行根本原因分析(RCA)的繁瑣工作,通常能精確定位到問題的具體程式碼行。
如何運作
Ongrid 使用分層代理系統,包含一個協調器,負責將任務分派給專門代理(如 SRE、網路或資料庫代理)。它與可觀察性堆疊(Prometheus、Loki、Tempo、Grafana)整合,並使用基於 RAG 的知識搜尋來索引操作手冊與事件歷史。系統可透過警示或使用者透過 Slack 或 Telegram 等聊天介面提出的查詢觸發,並包含「寫入門檻」機制,確保任何生產環境變更在執行前均需人工審核。
適用對象
專為管理複雜基礎設施(包括 Kubernetes 集群與網路裝置)的 SRE、DevOps 工程師與平台運營人員設計,幫助他們透過自動化調查降低平均修復時間(MTTR)。
主要特色
- 自動化根本原因分析:關聯可觀察性資料與架構拓撲,找出警示背後的「原因」。
- 多代理架構:使用協調器與專門代理來處理不同基礎設施領域。
- 與聊天系統整合:直接在 Slack、Telegram 等即時通訊頻道中運作。
- 安全存取:提供基於瀏覽器的 SSH shell,支援反向隧道,無需在主機上開放入站埠。
- 可擴展工具:支援 MCP 伺服器與自訂技能目錄,可新增新的運營工具。
- Kubernetes 管理:支援叢集註冊、工作負載檢視與生命週期升級。
這是一個真正能理解系統的 AI,它不只是報告問題,而是主動找出根本原因並提出解決方案。— @onchaindev
相關
- 專案
- 專案
- 專案
- 專案
- 專案