nudgebee/nudgebee

Unified CloudOps platform with AI-SRE, AI-FinOps, AI-K8sOps, and the Agentic Automation Builder without fragmented tools, context switching, or model lock-in.

What it solves

Nudgebee はオープンソースの SRE コパイロットで、Kubernetes と主要クラウドプロバイダー(AWS、Azure、GCP)上の可観測性、インシデント対応、クラウドコスト管理(FinOps)をシンプルにします。オペレーターが生のシグナルから実行可能な所見とガイド付きの修復へと移行できるよう支援します。

How it works

Nudgebee は Go、Python、TypeScript のサービスからなる分散アーキテクチャでインフラを監視します。クラウドプロバイダーのスキャンと Kubernetes コレクタでデータを取得し、以下の専門サーバーで処理します:

  • LLM & RAG Servers:エージェント型プランナーと Retrieval‑Augmented Generation を用いてインシデントの根本原因を特定し、修正案を提示します。
  • Runbook Server:Temporal ワークフローで繰り返しの修復をオーケストレーションします。
  • ML Server:Python ベースの ML パイプラインで Kubernetes ワークロードの適正サイズを推奨します。
  • Collector & Relay Servers:クラスター内エージェントを中央コントロールプレーンにブリッジします。
  • ChatOps:Slack と Teams と統合し、SRE がチャットから状態を問い合わせ、Runbook を直接実行できるようにします。

Who it’s for

複雑な Kubernetes 環境とマルチクラウド展開を管理する Site Reliability Engineers(SRE)やプラットフォームオペレーター向けに作られています。

Highlights

  • LLM-powered triage:インシデントを再現し根本原因を特定できるエージェント型プランナー。
  • FinOps optimization:アイドルワークロード、過大な Pod、古いスナップショットを検出し、クラウド支出を削減。
  • Runbook automation:繰り返しの修復を再利用可能でトリガー可能なワークフローとしてコード化。
  • Bidirectional ticketing sync:Jira、ServiceNow、PagerDuty、Zenduty と統合。
  • Multi-cloud support:AWS、Azure、GCP のネイティブな可観測性とスキャンを提供。