William-Lu-stack/Flawless

AI SRE AgenticOps for Kubernetes and cloud infrastructure.

What it solves

Flawless 是一個 AI 原生 SRE(Site Reliability Engineering)控制平面,旨在超越簡單的基礎設施管理 AI 對話介面。它透過將發現、診斷與修復連接成一個單一且可審計的循環,解決了 Kubernetes 和雲端環境中可觀測性碎片化以及風險高、未經驗證的手動修復問題。

How it works

Flawless 實作了「AgenticOps Loop」(discover → diagnose → preview → approve → execute → verify → learn)。它使用大型語言模型(LLM)作為規劃者與解釋者,但保持實際執行邊界的分離。系統會收集證據(日誌、指標、拓撲與事件),生成修復計畫,要求人工核准,透過受控工具(例如用於漸進式交付的 Argo Rollouts)執行變更,然後驗證原始症狀是否真的消失了,而不是僅僅假設指令執行成功。

Who it’s for

它是為管理 Kubernetes 和雲端基礎設施的 SRE 與平台工程師所設計的,這些工程師需要一種安全、自動化的方式來處理事故、進行根因分析,並維護一個可重複使用的操作「技能(Skills)」庫。

Highlights

  • Verified Recovery: 應用修復後會測試原始症狀,以證明系統已實際恢復。
  • Controlled Remediation: 整合了人工核准、RBAC 與試運行(dry-runs),以確保 AI 不會進行無導向的變更。
  • Progressive Delivery: 使用 Argo Rollouts 進行金絲雀部署與修復期間的風險控管容量恢復。
  • Skills Library: 將專家操作知識編碼為代理的可攜式、可重複使用的技能。
  • Topology Impact Analysis: 提供 2D/3D 拓撲與基於 eBPF 的數據流適配器,以分析故障的影響範圍(blast radius)。
  • Knowledge Base: 支援 RAG(Retrieval-Augmented Generation)技術,允許使用者上傳執行手冊(runbooks)、日誌與文件。"},

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案