ongridio/ongrid
An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.
解决的问题
Ongrid 是一款专为自动化基础设施故障调查和解决而设计的 AI 驱动运维代理。它通过关联系统拓扑结构中的指标、日志和追踪数据,减少 SRE 和运维人员查找根本原因所需的手动工作。
工作原理
该系统使用协调代理将任务分发给专家代理(如 SRE、网络或数据库代理)。它与可观测性技术栈(Prometheus, Loki, Tempo, Grafana)集成以收集证据,并通过遍历拓扑结构并将问题定位到特定的源代码行来执行根本原因分析 (RCA)。它通过 Slack 或 Telegram 等聊天界面运行,并包含一个用于人工批准高风险生产环境变更的“写入闸门 (write gate)”。
适用对象
需要在复杂的分布式系统中实现故障响应和根本原因分析自动化的基础设施工程师、站点可靠性工程师 (SRE) 和 DevOps 团队。
亮点
- 多智能体架构:使用协调者和专家代理进行针对性的故障排除。
- 自动调查:收到警报后自动启动 RCA 工作人员。
- RAG 知识库:索引运行手册、故障历史记录和代码库以获取运维上下文。
- 安全访问:具有基于浏览器的 SSH 反向隧道 Shell,无需入站端口或跳板机。
- 模型无关:支持包括 Anthropic, OpenAI, DeepSeek 和 Gemini 在内的各种 LLM。
- 支持 MCP 服务器:允许注册外部模型上下文协议 (MCP) 服务器以扩展代理能力。