ongridio/ongrid

An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.

解決的問題

Ongrid 是一個由 AI 驅動的運營代理,旨在自動化基礎設施問題的調查與修復。它透過跨系統架構相關聯的指標、日誌與追蹤資料,消除手動進行根本原因分析(RCA)的繁瑣工作,通常能精確定位到問題的具體程式碼行。

如何運作

Ongrid 使用分層代理系統,包含一個協調器,負責將任務分派給專門代理(如 SRE、網路或資料庫代理)。它與可觀察性堆疊(Prometheus、Loki、Tempo、Grafana)整合,並使用基於 RAG 的知識搜尋來索引操作手冊與事件歷史。系統可透過警示或使用者透過 Slack 或 Telegram 等聊天介面提出的查詢觸發,並包含「寫入門檻」機制,確保任何生產環境變更在執行前均需人工審核。

適用對象

專為管理複雜基礎設施(包括 Kubernetes 集群與網路裝置)的 SRE、DevOps 工程師與平台運營人員設計,幫助他們透過自動化調查降低平均修復時間(MTTR)。

主要特色

  • 自動化根本原因分析:關聯可觀察性資料與架構拓撲,找出警示背後的「原因」。
  • 多代理架構:使用協調器與專門代理來處理不同基礎設施領域。
  • 與聊天系統整合:直接在 Slack、Telegram 等即時通訊頻道中運作。
  • 安全存取:提供基於瀏覽器的 SSH shell,支援反向隧道,無需在主機上開放入站埠。
  • 可擴展工具:支援 MCP 伺服器與自訂技能目錄,可新增新的運營工具。
  • Kubernetes 管理:支援叢集註冊、工作負載檢視與生命週期升級。

這是一個真正能理解系統的 AI,它不只是報告問題,而是主動找出根本原因並提出解決方案。— @onchaindev

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案