nudgebee/nudgebee
Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.
Nudgebee – 開源 SRE 協作助手
功能
- 監控 Kubernetes 集群以及三大主流雲端平台(AWS、Azure、GCP)。
- 將原始事件、指標、追蹤資料與雲端供應商掃描結果轉化為優先排序的發現清單。
- 展示成本最佳化訊號(閒置工作負載、過度配置的 Pod、過期快照、懸空磁碟),並建議合適的資源調整方案。
- 使用 LLM 自動化故障排查:重現問題、提出根本原因、生成修復方案。
- 提供 ChatOps 接口(Slack / Teams),運維人員可在同一頻道中查詢狀態、執行執行手冊、確認警告並推動調查。
- 提供執行手冊引擎,將常見修復流程程式碼化,支援透過聊天、警告或定時任務觸發。
- 與工單系統(Jira、ServiceNow、PagerDuty、Zenduty)同步,並透過 Slack、Teams 或電子郵件發送通知。
技術架構
- 後端 – 一組 Go 服務(Gin HTTP 框架),負責租戶管理、整合、推薦邏輯與 RPC 網關。
- LLM 層 – Go 构建的
llm-server,搭配 RAG 伺服器與程式碼分析工作器,維護會話狀態,從 Qdrant 檢索相關向量,並執行按需程式碼分析。 - 執行手冊 – 透過 Temporal 工作流編排;專用的
runbook-server與 Temporal 通訊,狀態儲存於 Postgres,透過 RabbitMQ 互動。 - 資料儲存 – Postgres(核心狀態)、Redis(快取)、RabbitMQ(事件總線)、Qdrant(RAG 向量儲存)、Temporal(工作流引擎)。
- 採集器 – 運行在 Kubernetes 集群內的代理,以及掃描 AWS/Azure/GCP API 的雲端採集任務。它們將指標、事件與成本資料推送至中央總線。
- 前端 – 基於 Next.js(TypeScript)的儀表板(
app/),透過 GraphQL/RPC 與後端通訊,使用 NextAuth 處理認證,並托管聊天助手 UI。 - 部署 – 以 Helm Chart(OCI 托管)形式提供,打包所有必要基礎設施為子 Chart,同時提供 Docker-Compose 配置用於本地開發。
快速上手(本地開發)
- 安裝 Docker(或 Podman)與 compose,Go 1.26+,Node 25+。
- 執行
docker compose up -d啟動 Postgres、Redis、RabbitMQ、Qdrant、Temporal 和遷移容器。 - 複製後端(
api-server/services/.env)和前端(app/.env)的範例.env檔案,使用openssl rand -hex 32生成 32 字節加密金鑰,並將同一金鑰填入兩個檔案。 - 運行 Go 後端(
make run或go run ./cmd)——監聽 http://localhost:8000。 - 安裝前端相依性(
npm install --legacy-peer-deps),啟動開發伺服器(npm run dev)。UI 可透過 http://localhost:3000 訪問。 - 使用任意電子信箱登入,密碼為開發認證提供者提供的
Test!24#5。
生產環境部署
- 從
oci://ghcr.io/nudgebee/charts/nudgebee安裝 Helm Chart。 - 透過 Chart 的
nudgebee_secret值提供永久的NUDGEBEE_ENCRYPTION_KEY(使用 OpenSSL 一次性生成)。 - Chart 會部署與 compose 堆疊相同的基礎設施元件,並執行安裝後鈎子以應用資料庫遷移。
- Pod 準備就緒後,端口轉發
app服務,使用密鑰中生成的管理員密碼登入。
典型工作流程
- 連接集群或雲端帳戶 → 採集器填入資源、指標與支出的知識圖譜。
- 查看儀表板 – 發現結果按優先順序排序;成本最佳化建議將顯示。
- 向 AI 助手提問(右下角聊天框):「為什麼 Pod
frontend-abc使用了 2 CPU?」——LLM 利用檢索到的上下文進行解釋,可能建議調整資源配置。 - 執行執行手冊 – 可手動從 Runbooks → Library 頁面觸發,或透過 ChatOps 命令自動執行。執行手冊以 Temporal 工作流形式執行,透過中繼伺服器與集群互動。
- 閉環處理 – 通知發送至 Slack/Teams,Jira 或 ServiceNow 中建立/更新工單,事件標記為已解決。
適用對象
- 需要統一視圖進行可觀測性、成本控制與事件回應的 SRE。
- 管理多雲工作負載並希望獲得 AI 輔助排查的雲原生團隊。
- 尋找商業 SRE 「協作者」平台自托管替代方案的組織。
取得協助 / 貢獻
- Discord: https://discord.gg/C5d27ceTEv
- Issues: 使用提供的 bug 報告與功能請求模板。
- 新手友善標籤
good-first-issue。 - CLA、分支模型與 PR 指南請參閱
CONTRIBUTING.md。
以上所有資訊均直接來自倉儲 README,未推斷額外功能。
相關
- 專案
- 專案
- 專案
- 專案
- 專案