nudgebee/nudgebee
Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.
Nudgebee – 오픈소스 SRE 코피로트
기능
- Kubernetes 클러스터와 주요 3대 클라우드(AWS, Azure, GCP)를 모니터링합니다.
- 원시 이벤트, 메트릭, 트레이스, 클라우드 프로바이더 스캔을 기반으로 우선순위가 매겨진 발견 목록을 생성합니다.
- 비용 최적화 신호(미사용 워크로드, 과도한 포드, 오래된 스냅샷, 떠도는 볼륨)를 표시하고 적절한 크기 조정 조치를 제안합니다.
- LLM을 사용해 인시던트를 자동으로 트리아주: 문제 재현, 근본 원인 제안, 복구 계획 생성.
- ChatOps 인터페이스(Slack / Teams)를 제공하여 운영자가 상태를 질의하고, 런북을 실행하며, 알림을 확인하고, 온콜 중인 채널에서 조사를 진행할 수 있습니다.
- 반복적인 수정을 코드화한 런북 엔진을 제공하며, 채팅, 알림, 스케줄에서 트리거할 수 있습니다.
- 티켓 시스템(Jira, ServiceNow, PagerDuty, Zenduty)과 동기화하고, Slack, Teams, 이메일을 통해 알림을 전달합니다.
구성 방식
- 백엔드 – 테넌트, 통합, 추천 로직, RPC 게이트웨이를 처리하는 Go 서비스 집합(Gin HTTP 프레임워크).
- LLM 계층 – Go 기반의
llm-server와 RAG 서버, 코드 분석 워커. 세션 상태를 유지하고 Qdrant에서 관련 벡터를 검색하며, 필요 시 코드 분석을 실행합니다. - 런북 – Temporal 워크플로우로 오케스트레이션. 전용
runbook-server가 Temporal과 통신하고 Postgres에 상태를 저장하며 RabbitMQ를 통해 통신합니다. - 데이터 스토어 – Postgres(핵심 상태), Redis(캐시), RabbitMQ(이벤트 버스), Qdrant(RAG용 벡터 스토어), Temporal(워크플로우 엔진).
- 컬렉터 – Kubernetes 클러스터 내부에서 실행되는 에이전트와 AWS/Azure/GCP API를 스캔하는 클라우드 컬렉터 작업. 메트릭, 이벤트, 비용 데이터를 중앙 버스로 전송합니다.
- 프론트엔드 – GraphQL/RPC를 통해 백엔드와 통신하는 Next.js(TypeScript) 대시보드(
app/)로, NextAuth를 사용한 인증을 처리하고 챗 어시스턴트 UI를 호스팅합니다. - 배포 – Helm 차트(OCI 호스팅)로 제공되며, 모든 필요한 인프라를 서브차트로 패키징하고, 로컬 개발용 Docker-Compose 설정도 제공합니다.
시작하기 (로컬 개발)
- Docker(또는 Podman)와 compose, Go 1.26+, Node 25+ 설치.
docker compose up -d로 Postgres, Redis, RabbitMQ, Qdrant, Temporal, 마이그레이션 컨테이너를 시작.- 백엔드(
api-server/services/.env)와 프론트엔드(app/.env)용 예제.env파일을 복사하고,openssl rand -hex 32로 32바이트 암호화 키를 생성해 두 파일에 동일한 키를 배치. - Go 백엔드 실행(
make run또는go run ./cmd) — http://localhost:8000에서 리스닝. - 프론트엔드 종속성 설치(
npm install --legacy-peer-deps) 및 개발 서버 시작(npm run dev). UI는 http://localhost:3000에서 접근 가능. - 임의의 이메일로 로그인하고, 개발 인증 제공자에서 제공하는 임시 비밀번호
Test!24#5사용.
프로덕션 배포
oci://ghcr.io/nudgebee/charts/nudgebee에서 Helm 차트 설치.- OpenSSL로 한 번 생성한 영구적인
NUDGEBEE_ENCRYPTION_KEY를 차트의nudgebee_secret값으로 제공. - 차트는 compose 스택과 동일한 인프라 컴포넌트를 프로비저닝하고, 데이터베이스 마이그레이션을 실행하는 포스트-인스톨 훅을 실행합니다.
- 파드가 준비되면
app서비스의 포트포워딩을 수행하고, 시크릿에서 생성된 관리자 비밀번호로 로그인.
일반적인 워크플로우
- 클러스터 또는 클라우드 계정 연결 → 컬렉터가 리소스, 메트릭, 지출의 지식 그래프를 채웁니다.
- 대시보드 확인 – 발견 결과는 우선순위로 정렬되며, 비용 최적화 제안이 표시됩니다.
- AI 어시스턴트(우측하단 채팅)에 "왜 포드
frontend-abc가 2CPU를 사용하고 있나요?"와 같은 질문을 던지세요. LLM은 검색된 컨텍스트를 사용해 설명하고, 적절한 크기 조정을 제안할 수 있습니다. - 런북 실행 – Runbooks → Library 페이지에서 수동으로 실행하거나, ChatOps 명령어로 자동 실행. 런북은 Temporal 워크플로우로 실행되며, 리레이 서버를 통해 클러스터와 상호작용합니다.
- 루프 닫기 – Slack/Teams에 알림 전송, Jira 또는 ServiceNow에서 티켓 생성/업데이트, 인시던트를 해결됨으로 표시.
누가 사용할 수 있나요
- 오브저버빌리티, 비용 제어, 인시던트 대응을 위한 단일 패널이 필요한 사이트 신뢰성 엔지니어(SRE).
- 다중 클라우드 워크로드를 관리하고 AI 지원 트리아주를 원하는 클라우드 네이티브 팀.
- 상용 SRE "코피로트" 플랫폼의 자체 호스팅 대안을 찾는 조직.
도움 받기 / 기여하기
- Discord: https://discord.gg/C5d27ceTEv
- Issues: 제공된 버그 리포트 및 기능 요청 템플릿 사용.
- 초보자용
good-first-issue라벨. - CLA, 브랜치 모델, PR 가이드라인은
CONTRIBUTING.md참조.
위 모든 세부 정보는 리포지토리의 README에서 직접 가져왔으며, 추가 기능은 추측되지 않았습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트