nudgebee/nudgebee
Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.
What it solves
Nudgebee 是一个开源的 SRE 副驾驶,旨在简化 Kubernetes 与主要云服务提供商(AWS、Azure、GCP)上的可观测性、事故响应和云成本管理(FinOps)。它帮助运维人员从原始信号转化为可执行的发现和指导性修复。
How it works
Nudgebee 使用 Go、Python 与 TypeScript 服务的分布式架构来监控基础设施。它通过云提供商扫描和 Kubernetes 收集器获取数据,然后通过多个专用服务器处理这些信息:
- LLM & RAG Servers:使用代理式规划器和检索增强生成(RAG)来根因分析事故并提出修复建议。
- Runbook Server:利用 Temporal 工作流编排重复性修复。
- ML Server:使用基于 Python 的机器学习管道为 Kubernetes 工作负载推荐合适的规模。
- Collector & Relay Servers:将集群内代理桥接到中央控制平面。
- ChatOps:集成 Slack 和 Teams,让 SRE 能在聊天中查询状态并直接运行 Runbook。
Who it’s for
它面向管理复杂 Kubernetes 环境和多云部署的 Site Reliability Engineers(SRE)以及平台运营者。
Highlights
- LLM-powered triage:能够复现并根因分析事故的代理式规划器。
- FinOps optimization:识别闲置工作负载、过大 Pod 和过时快照,以降低云支出。
- Runbook automation:将重复性修复编码为可重用、可触发的工作流。
- Bidirectional ticketing sync:集成 Jira、ServiceNow、PagerDuty 和 Zenduty。
- Multi-cloud support:原生支持 AWS、Azure 与 GCP 的可观测性和扫描。