nudgebee/nudgebee

Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.

What it solves

Nudgebee는 오픈소스 SRE 코파일럿으로, Kubernetes와 주요 클라우드 제공업체(AWS, Azure, GCP)에서 가시성, 인시던트 대응 및 클라우드 비용 관리(FinOps)를 단순화하도록 설계되었습니다. 운영자가 원시 신호를 실행 가능한 인사이트와 가이드된 복구로 전환하도록 돕습니다.

How it works

Nudgebee는 Go, Python, TypeScript 서비스로 구성된 분산 아키텍처를 사용해 인프라를 모니터링합니다. 클라우드 제공업체 스캔 및 Kubernetes 컬렉터를 통해 데이터를 수집한 뒤, 여러 특화 서버를 통해 처리합니다:

  • LLM & RAG Servers: 에이전트형 플래너와 Retrieval‑Augmented Generation을 활용해 인시던트의 근본 원인을 파악하고 해결책을 제시합니다.
  • Runbook Server: Temporal 워크플로우를 사용해 반복적인 복구 작업을 오케스트레이션합니다.
  • ML Server: Python 기반 ML 파이프라인으로 Kubernetes 워크로드의 적정 규모를 추천합니다.
  • Collector & Relay Servers: 클러스터 내부 에이전트를 중앙 제어 플레인에 연결합니다.
  • ChatOps: Slack 및 Teams와 통합되어 SRE가 채팅에서 상태를 조회하고 Runbook을 직접 실행할 수 있게 합니다.

Who it’s for

복잡한 Kubernetes 환경과 멀티클라우드 배포를 관리하는 Site Reliability Engineers(SRE)와 플랫폼 운영자를 위해 구축되었습니다.

Highlights

  • LLM-powered triage: 인시던트를 재현하고 근본 원인을 찾을 수 있는 에이전트형 플래너.
  • FinOps optimization: 유휴 워크로드, 과다한 Pod, 오래된 스냅샷을 식별해 클라우드 비용을 절감.
  • Runbook automation: 반복적인 복구를 재사용 가능하고 트리거 가능한 워크플로우로 코드화.
  • Bidirectional ticketing sync: Jira, ServiceNow, PagerDuty, Zenduty와 통합.
  • Multi-cloud support: AWS, Azure, GCP에 대한 네이티브 가시성 및 스캔 지원.