nudgebee/nudgebee
Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.
Nudgebee – 开源 SRE 协作助手
功能
- 监控 Kubernetes 集群以及三大主流云平台(AWS、Azure、GCP)。
- 将原始事件、指标、追踪数据和云提供商扫描结果转化为优先级排序的发现列表。
- 展示成本优化信号(闲置工作负载、过度配置的 Pod、过期快照、悬空卷),并建议合适的资源调整方案。
- 使用 LLM 自动化故障排查:复现问题、提出根本原因、生成修复方案。
- 提供 ChatOps 接口(Slack / Teams),运维人员可在同一频道中查询状态、执行运行手册、确认告警并推动调查。
- 提供运行手册引擎,将常见修复流程代码化,支持通过聊天、告警或定时任务触发。
- 与工单系统(Jira、ServiceNow、PagerDuty、Zenduty)同步,并通过 Slack、Teams 或邮件发送通知。
技术架构
- 后端 – 一组 Go 服务(Gin HTTP 框架),负责租户管理、集成、推荐逻辑和 RPC 网关。
- LLM 层 – Go 构建的
llm-server,搭配 RAG 服务器和代码分析工作器,维护会话状态,从 Qdrant 检索相关向量,并执行按需代码分析。 - 运行手册 – 通过 Temporal 工作流编排;专用的
runbook-server与 Temporal 通信,状态存储于 Postgres,通过 RabbitMQ 交互。 - 数据存储 – Postgres(核心状态)、Redis(缓存)、RabbitMQ(事件总线)、Qdrant(RAG 向量存储)、Temporal(工作流引擎)。
- 采集器 – 运行在 Kubernetes 集群内的代理,以及扫描 AWS/Azure/GCP API 的云采集任务。它们将指标、事件和成本数据推送至中央总线。
- 前端 – 基于 Next.js(TypeScript)的仪表盘(
app/),通过 GraphQL/RPC 与后端通信,使用 NextAuth 处理认证,并托管聊天助手 UI。 - 部署 – 以 Helm Chart(OCI 托管)形式提供,打包所有必需基础设施为子 Chart,同时提供 Docker-Compose 配置用于本地开发。
快速上手(本地开发)
- 安装 Docker(或 Podman)与 compose,Go 1.26+,Node 25+。
- 执行
docker compose up -d启动 Postgres、Redis、RabbitMQ、Qdrant、Temporal 和迁移容器。 - 复制后端(
api-server/services/.env)和前端(app/.env)的示例.env文件,使用openssl rand -hex 32生成 32 字节加密密钥,并将同一密钥填入两个文件。 - 运行 Go 后端(
make run或go run ./cmd)——监听 http://localhost:8000。 - 安装前端依赖(
npm install --legacy-peer-deps),启动开发服务器(npm run dev)。UI 可通过 http://localhost:3000 访问。 - 使用任意邮箱登录,密码为开发认证提供者提供的
Test!24#5。
生产环境部署
- 从
oci://ghcr.io/nudgebee/charts/nudgebee安装 Helm Chart。 - 通过 Chart 的
nudgebee_secret值提供永久的NUDGEBEE_ENCRYPTION_KEY(使用 OpenSSL 一次性生成)。 - Chart 会部署与 compose 堆栈相同的基础设施组件,并运行安装后钩子以应用数据库迁移。
- Pod 准备就绪后,端口转发
app服务,使用密钥中生成的管理员密码登录。
典型工作流
- 连接集群或云账户 → 采集器填充资源、指标和支出的知识图谱。
- 查看仪表盘 – 发现结果按优先级排序;成本优化建议将显示。
- 向 AI 助手提问(右下角聊天框):“为什么 Pod
frontend-abc使用了 2 CPU?”——LLM 利用检索到的上下文进行解释,可能建议调整资源配置。 - 执行运行手册 – 可手动从 Runbooks → Library 页面触发,或通过 ChatOps 命令自动执行。运行手册以 Temporal 工作流形式运行,通过中继服务器与集群交互。
- 闭环处理 – 通知发送至 Slack/Teams,Jira 或 ServiceNow 中创建/更新工单,事件标记为已解决。
适用人群
- 需要统一视图进行可观测性、成本控制和事件响应的 SRE。
- 管理多云工作负载并希望获得 AI 辅助排查的云原生团队。
- 寻找商业 SRE “协作者” 平台自托管替代方案的组织。
获取帮助 / 贡献
- Discord: https://discord.gg/C5d27ceTEv
- Issues: 使用提供的 bug 报告和功能请求模板。
- 新手友好标签
good-first-issue。 - CLA、分支模型和 PR 指南请参阅
CONTRIBUTING.md。
以上所有信息均直接来自仓库 README,未推断额外功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目