Tracer-Cloud/opensre
Build your own AI SRE agents. The open source toolkit for the AI era.
解决的问题
OpenSRE 提供了一个构建 AI 站点可靠性工程 (SRE) 智能体的框架,该智能体可以自动调查并解决生产事故。通过为智能体事故响应和训练提供标准化环境,解决了分布式故障调试难的问题(证据通常分散在日志、指标和追踪中)。
工作原理
当警报触发时,系统遵循结构化流程:
- 上下文收集:获取相关的日志、指标、追踪和部署历史。
- 隐私保护:在将数据发送到 LLM 之前,可选择性地对敏感标识符进行脱敏。
- 推理:智能体使用工具调用循环在连接的系统中测试假设。
- 报告:生成结构化的调查报告,通过关联证据识别可能的根本原因。
- 修复:建议或执行解决问题的后续步骤。
- 通知:将摘要发布到 Slack 或 Telegram 等通信工具。
适用对象
该工具专为希望使用 AI 智能体实现生产调试和根本原因分析 (RCA) 自动化的 SRE、DevOps 工程师和开发人员设计。
亮点
- 广泛的集成:连接超过 60 种工具,涵盖可观测性 (Grafana, Datadog, Sentry)、基础设施 (Kubernetes, AWS, GCP) 和数据库 (PostgreSQL, MongoDB)。
- 训练与评估:包含合成事故模拟和端到端测试,用于基准测试并提高智能体性能。
- 灵活的 LLM 支持:兼容包括 Anthropic, OpenAI, Gemini 以及通过 Ollama 运行的本地模型在内的各种提供商。
- Runbook 感知:智能体在调查过程中可以自动读取并应用现有的运行手册 (Runbooks)。
相关
- 项目
- 项目
- 项目
- 项目
- 项目