nudgebee/nudgebee
Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.
What it solves
Nudgebee 是一個開源的 SRE 副駕駛,旨在簡化 Kubernetes 與主要雲服務提供商(AWS、Azure、GCP)上的觀測性、事故回應與雲端成本管理(FinOps)。它協助操作人員從原始訊號轉換為可執行的發現與指導式修復。
How it works
Nudgebee 使用 Go、Python 與 TypeScript 服務的分散式架構來監控基礎設施。它透過雲端供應商掃描與 Kubernetes 收集器取得資料,然後由多個專門的伺服器處理這些資訊:
- LLM & RAG Servers:使用代理式規劃器與檢索增強生成(RAG)來根因分析事故並提出修復建議。
- Runbook Server:利用 Temporal 工作流程協調重複性修復。
- ML Server:使用 Python ML 管線為 Kubernetes 工作負載提供適當規模建議。
- Collector & Relay Servers:將叢集內代理橋接至中央控制平面。
- ChatOps:整合 Slack 與 Teams,讓 SRE 能在聊天中查詢狀態並直接執行 Runbook。
Who it’s for
此工具為管理複雜 Kubernetes 環境與多雲部署的 Site Reliability Engineers(SRE)與平台運營者而建。
Highlights
- LLM-powered triage:能夠重現並根因分析事故的代理式規劃器。
- FinOps optimization:辨識閒置工作負載、過大 Pod 與過時快照,以降低雲端支出。
- Runbook automation:將重複性修復編碼為可重用、可觸發的工作流程。
- Bidirectional ticketing sync:整合 Jira、ServiceNow、PagerDuty 與 Zenduty。
- Multi-cloud support:原生支援 AWS、Azure 與 GCP 的觀測性與掃描。