qinshihu/itops-agent-platform

China's 1st enterprise multi-agent IT ops platform. LLM-powered auto-remediation for Zabbix/Prometheus. Docker deploy.

解决的问题

ITOps Agent Platform 解决了传统 IT 运维效率低下和压力大的问题。该平台将从接收告警到验证的整个生命周期自动化,将响应时间缩短至 3 分钟以内,而不是每个事件花费 30-60 分钟进行手动排障(VPN 登录、SSH、命令行调查)。

工作原理

该平台利用多智能体 AI 系统实现“感知 $\rightarrow$ 诊断 $\rightarrow$ 决策 $\rightarrow$ 执行 $\rightarrow$ 验证”的闭环工作流:

  1. 告警集成:通过 Webhooks 从 Prometheus 或 Zabbix 等工具接收告警。
  2. AI 诊断:多个 AI 智能体协作分析日志和指标,以查找根本原因并生成自然语言报告。
  3. 决策与审批:AI 生成结构化的修复命令和风险评估,并推送到移动应用(WeCom、DingTalk)进行人机回环 (HITL) 审批。
  4. 执行:审批通过后,平台通过 SSH 或 API 执行命令并自动验证结果。
  5. 基础设施管理:提供统一的界面来管理 Docker 容器、VMware/KVM 虚拟机、Kubernetes 集群和物理数据中心资产(包括 3D 数字孪生)。

适用对象

  • 运维工程师 & SRE:消除深夜手动排障和工具切换。
  • IT 经理/CTO:从被动的“靠运气”恢复转向自主的自愈策略。
  • 中小企业:作为 PagerDuty、Rundeck 和 Portainer 等昂贵商业套件的免费开源替代方案。
  • 安全团队:确保所有修复操作都经过审计和批准。

亮点

  • 多智能体编排:使用 12 个专门的 AI 智能体进行协作推理,而不是单次 LLM 调用。
  • 全链路自动化:实现了从告警到验证的完整路径工程实现。
  • 人机回环 (HITL):集成的移动审批流程,确保生产环境的安全。
  • 统一基础设施控制:将容器、虚拟机、K8s 和网络设备管理整合在一个平台中。
  • 命令安全引擎:包含安全策略和基于角色的访问控制,以过滤危险的 AI 生成命令。
  • 本地 AI 支持:支持本地 LLM 部署,将敏感的运维数据保留在企业边界内。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目