ongridio/ongrid
An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.
它解决了什么问题
Ongrid 是一个由人工智能驱动的运维代理,旨在自动化基础设施问题的调查与修复。它通过关联系统拓扑中的指标、日志和追踪数据,消除手动进行根本原因分析(RCA)的繁琐工作,通常能精准定位到具体代码行。
它如何工作
Ongrid 使用分层代理系统,包含一个协调器,负责将任务分发给专业代理(如 SRE、网络或数据库代理)。它与可观测性堆栈(Prometheus、Loki、Tempo、Grafana)集成,并使用基于 RAG 的知识搜索来索引操作手册和事件历史。该系统可通过警报或通过 Slack 或 Telegram 等聊天界面的用户查询触发,并包含一个“写入门禁”机制,在任何生产变更执行前需经人工审批。
适合谁使用
专为 SRE、DevOps 工程师和平台运维人员设计,适用于管理复杂基础设施(包括 Kubernetes 集群和网络设备)并希望借助自动化调查手段降低平均恢复时间(MTTR)的用户。
主要亮点
- 自动化根本原因分析:关联可观测性数据和拓扑信息,识别告警背后的“原因”。
- 多代理架构:使用协调器和专业代理来处理不同的基础设施领域。
- 与聊天工具无缝衔接:可直接在 Slack、Telegram 和其他即时通讯渠道中运行。
- 安全访问:提供基于浏览器的 SSH shell,采用反向隧道技术,无需在主机上开放入站端口。
- 可扩展的工具链:支持 MCP 服务器和自定义技能目录,便于添加新的运维工具。
- Kubernetes 管理:支持集群注册、工作负载检查和生命周期升级。
一个真正能理解系统上下文并自动执行修复的 AI 运维代理——@on_grid
相关
- 项目
- 项目
- 项目
- 项目
- 项目