William-Lu-stack/Flawless
AI SRE AgenticOps for Kubernetes and cloud infrastructure.
What it solves
Flawless 是一个 AI 原生 SRE(Site Reliability Engineering)控制平面,旨在超越简单的基础设施管理 AI 对话界面。它通过将发现、诊断和修复连接成一个单一且可审计的循环,解决了 Kubernetes 和云端环境中的可观测性碎片化以及风险高、未经验证的手动修复问题。
How it works
Flawless 实现了 ""AgenticOps Loop"" (discover → diagnose → preview → approve → execute → verify → learn)。它使用大语言模型(LLM)作为规划者和解释者,但保持实际执行边界的分离。系统会收集证据(日志、指标、拓扑和事件),生成修复计划,要求人工审批,通过受控工具(如用于渐进式交付的 Argo Rollouts)执行变更,并验证原始故障症状是否真的消失了,而不是仅仅假设命令执行成功。
Who it’s for
它是为管理 Kubernetes 和云端基础设施的 SRE 和平台工程师设计的,这些工程师需要一种安全、自动化的方式来处理故障、进行根因分析,并维护一个可重复使用的操作 ""Skills"" 库。
Highlights
- Verified Recovery: 应用修复后会测试原始故障症状,以证明系统已真正恢复。
- Controlled Remediation: 集成了人工审批、RBAC 和试运行(dry-runs)以确保 AI 不会进行无引导的变更。
- Progressive Delivery: 使用 Argo Rollouts 进行金丝雀部署和修复期间的风险控管容量恢复。
- Skills Library: 将专家操作知识编码为代理的可移植、可重复使用的 skills。
- Topology Impact Analysis: 基于 eBPF 的 2D/3D 拓扑和数据流适配器,用于分析故障的爆炸半径(blast radius)。
- Knowledge Base: Supports RAG (Retrieval-Augmented Generation) 通过允许用户上传 runbooks、日志和文档。
相关
- 项目
- 项目
- 项目
- 项目
- 项目