nudgebee/nudgebee

Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.

Nudgebee – 开源 SRE 协作助手

功能

  • 监控 Kubernetes 集群以及三大主流云平台(AWS、Azure、GCP)。
  • 将原始事件、指标、追踪数据和云提供商扫描结果转化为优先级排序的发现列表。
  • 展示成本优化信号(闲置工作负载、过度配置的 Pod、过期快照、悬空卷),并建议合适的资源调整方案。
  • 使用 LLM 自动化故障排查:复现问题、提出根本原因、生成修复方案。
  • 提供 ChatOps 接口(Slack / Teams),运维人员可在同一频道中查询状态、执行运行手册、确认告警并推动调查。
  • 提供运行手册引擎,将常见修复流程代码化,支持通过聊天、告警或定时任务触发。
  • 与工单系统(Jira、ServiceNow、PagerDuty、Zenduty)同步,并通过 Slack、Teams 或邮件发送通知。

技术架构

  • 后端 – 一组 Go 服务(Gin HTTP 框架),负责租户管理、集成、推荐逻辑和 RPC 网关。
  • LLM 层 – Go 构建的 llm-server,搭配 RAG 服务器和代码分析工作器,维护会话状态,从 Qdrant 检索相关向量,并执行按需代码分析。
  • 运行手册 – 通过 Temporal 工作流编排;专用的 runbook-server 与 Temporal 通信,状态存储于 Postgres,通过 RabbitMQ 交互。
  • 数据存储 – Postgres(核心状态)、Redis(缓存)、RabbitMQ(事件总线)、Qdrant(RAG 向量存储)、Temporal(工作流引擎)。
  • 采集器 – 运行在 Kubernetes 集群内的代理,以及扫描 AWS/Azure/GCP API 的云采集任务。它们将指标、事件和成本数据推送至中央总线。
  • 前端 – 基于 Next.js(TypeScript)的仪表盘(app/),通过 GraphQL/RPC 与后端通信,使用 NextAuth 处理认证,并托管聊天助手 UI。
  • 部署 – 以 Helm Chart(OCI 托管)形式提供,打包所有必需基础设施为子 Chart,同时提供 Docker-Compose 配置用于本地开发。

快速上手(本地开发)

  1. 安装 Docker(或 Podman)与 compose,Go 1.26+,Node 25+。
  2. 执行 docker compose up -d 启动 Postgres、Redis、RabbitMQ、Qdrant、Temporal 和迁移容器。
  3. 复制后端(api-server/services/.env)和前端(app/.env)的示例 .env 文件,使用 openssl rand -hex 32 生成 32 字节加密密钥,并将同一密钥填入两个文件。
  4. 运行 Go 后端(make rungo run ./cmd)——监听 http://localhost:8000
  5. 安装前端依赖(npm install --legacy-peer-deps),启动开发服务器(npm run dev)。UI 可通过 http://localhost:3000 访问。
  6. 使用任意邮箱登录,密码为开发认证提供者提供的 Test!24#5

生产环境部署

  • oci://ghcr.io/nudgebee/charts/nudgebee 安装 Helm Chart。
  • 通过 Chart 的 nudgebee_secret 值提供永久的 NUDGEBEE_ENCRYPTION_KEY(使用 OpenSSL 一次性生成)。
  • Chart 会部署与 compose 堆栈相同的基础设施组件,并运行安装后钩子以应用数据库迁移。
  • Pod 准备就绪后,端口转发 app 服务,使用密钥中生成的管理员密码登录。

典型工作流

  1. 连接集群或云账户 → 采集器填充资源、指标和支出的知识图谱。
  2. 查看仪表盘 – 发现结果按优先级排序;成本优化建议将显示。
  3. 向 AI 助手提问(右下角聊天框):“为什么 Pod frontend-abc 使用了 2 CPU?”——LLM 利用检索到的上下文进行解释,可能建议调整资源配置。
  4. 执行运行手册 – 可手动从 Runbooks → Library 页面触发,或通过 ChatOps 命令自动执行。运行手册以 Temporal 工作流形式运行,通过中继服务器与集群交互。
  5. 闭环处理 – 通知发送至 Slack/Teams,Jira 或 ServiceNow 中创建/更新工单,事件标记为已解决。

适用人群

  • 需要统一视图进行可观测性、成本控制和事件响应的 SRE。
  • 管理多云工作负载并希望获得 AI 辅助排查的云原生团队。
  • 寻找商业 SRE “协作者” 平台自托管替代方案的组织。

获取帮助 / 贡献

  • Discord: https://discord.gg/C5d27ceTEv
  • Issues: 使用提供的 bug 报告和功能请求模板。
  • 新手友好标签 good-first-issue
  • CLA、分支模型和 PR 指南请参阅 CONTRIBUTING.md

以上所有信息均直接来自仓库 README,未推断额外功能。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目