qinshihu/itops-agent-platform
China's 1st enterprise multi-agent IT ops platform. LLM-powered auto-remediation for Zabbix/Prometheus. Docker deploy.
解决的问题
ITOps Agent Platform 解决了传统 IT 运维效率低下和压力大的问题。该平台将从接收告警到验证的整个生命周期自动化,将响应时间缩短至 3 分钟以内,而不是每个事件花费 30-60 分钟进行手动排障(VPN 登录、SSH、命令行调查)。
工作原理
该平台利用多智能体 AI 系统实现“感知 $\rightarrow$ 诊断 $\rightarrow$ 决策 $\rightarrow$ 执行 $\rightarrow$ 验证”的闭环工作流:
- 告警集成:通过 Webhooks 从 Prometheus 或 Zabbix 等工具接收告警。
- AI 诊断:多个 AI 智能体协作分析日志和指标,以查找根本原因并生成自然语言报告。
- 决策与审批:AI 生成结构化的修复命令和风险评估,并推送到移动应用(WeCom、DingTalk)进行人机回环 (HITL) 审批。
- 执行:审批通过后,平台通过 SSH 或 API 执行命令并自动验证结果。
- 基础设施管理:提供统一的界面来管理 Docker 容器、VMware/KVM 虚拟机、Kubernetes 集群和物理数据中心资产(包括 3D 数字孪生)。
适用对象
- 运维工程师 & SRE:消除深夜手动排障和工具切换。
- IT 经理/CTO:从被动的“靠运气”恢复转向自主的自愈策略。
- 中小企业:作为 PagerDuty、Rundeck 和 Portainer 等昂贵商业套件的免费开源替代方案。
- 安全团队:确保所有修复操作都经过审计和批准。
亮点
- 多智能体编排:使用 12 个专门的 AI 智能体进行协作推理,而不是单次 LLM 调用。
- 全链路自动化:实现了从告警到验证的完整路径工程实现。
- 人机回环 (HITL):集成的移动审批流程,确保生产环境的安全。
- 统一基础设施控制:将容器、虚拟机、K8s 和网络设备管理整合在一个平台中。
- 命令安全引擎:包含安全策略和基于角色的访问控制,以过滤危险的 AI 生成命令。
- 本地 AI 支持:支持本地 LLM 部署,将敏感的运维数据保留在企业边界内。
相关
- 项目
- 项目
- 项目
- 项目
- 项目