nudgebee/nudgebee

Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.

What it solves

Nudgebee 是一个开源的 SRE 副驾驶,旨在简化 Kubernetes 与主要云服务提供商(AWS、Azure、GCP)上的可观测性、事故响应和云成本管理(FinOps)。它帮助运维人员从原始信号转化为可执行的发现和指导性修复。

How it works

Nudgebee 使用 Go、Python 与 TypeScript 服务的分布式架构来监控基础设施。它通过云提供商扫描和 Kubernetes 收集器获取数据,然后通过多个专用服务器处理这些信息:

  • LLM & RAG Servers:使用代理式规划器和检索增强生成(RAG)来根因分析事故并提出修复建议。
  • Runbook Server:利用 Temporal 工作流编排重复性修复。
  • ML Server:使用基于 Python 的机器学习管道为 Kubernetes 工作负载推荐合适的规模。
  • Collector & Relay Servers:将集群内代理桥接到中央控制平面。
  • ChatOps:集成 Slack 和 Teams,让 SRE 能在聊天中查询状态并直接运行 Runbook。

Who it’s for

它面向管理复杂 Kubernetes 环境和多云部署的 Site Reliability Engineers(SRE)以及平台运营者。

Highlights

  • LLM-powered triage:能够复现并根因分析事故的代理式规划器。
  • FinOps optimization:识别闲置工作负载、过大 Pod 和过时快照,以降低云支出。
  • Runbook automation:将重复性修复编码为可重用、可触发的工作流。
  • Bidirectional ticketing sync:集成 Jira、ServiceNow、PagerDuty 和 Zenduty。
  • Multi-cloud support:原生支持 AWS、Azure 与 GCP 的可观测性和扫描。