qinshihu/itops-agent-platform

China's 1st enterprise multi-agent IT ops platform. LLM-powered auto-remediation for Zabbix/Prometheus. Docker deploy.

解決的問題

ITOps Agent Platform 解決了傳統 IT 維運效率低下和壓力大的問題。該平台將從接收告警到驗證的整個生命週期自動化,將回應時間縮短至 3 分鐘以內,而不是每個事件花費 30-60 分鐘進行手動排障(VPN 登入、SSH、命令列調查)。

工作原理

該平台利用多智能體 AI 系統實現「感知 $\rightarrow$ 診斷 $\rightarrow$ 決策 $\rightarrow$ 執行 $\rightarrow$ 驗證」的閉環工作流:

  1. 告警集成:透過 Webhooks 從 Prometheus 或 Zabbix 等工具接收告警。
  2. AI 診斷:多個 AI 智能體協作分析日誌和指標,以尋找根本原因並生成自然語言報告。
  3. 決策與審批:AI 生成結構化的修復命令和風險評估,並推送到行動應用程式(WeCom、DingTalk)進行人機回環 (HITL) 審批。
  4. 執行:審批通過後,平台透過 SSH 或 API 執行命令並自動驗證結果。
  5. 基礎設施管理:提供統一的介面來管理 Docker 容器、VMware/KVM 虛擬機器、Kubernetes 集群和物理數據中心資產(包括 3D 數位雙生)。

適用對象

  • 維運工程師 & SRE:消除深夜手動排障和工具切換。
  • IT 經理/CTO:從被動的「靠運氣」復原轉向自主的自癒策略。
  • 中小企業:作為 PagerDuty、Rundeck 和 Portainer 等昂貴商業套件的免費開源替代方案。
  • 安全團隊:確保所有修復操作都經過審計和批准。

亮點

  • 多智能體編排:使用 12 個專門的 AI 智能體進行協作推理,而不是單次 LLM 呼叫。
  • 全鏈路自動化:實現了從告警到驗證的完整路徑工程實現。
  • 人機回環 (HITL):整合的行動審批流程,確保生產環境的安全。
  • 統一基礎設施控制:將容器、虛擬機器、K8s 和網路設備管理整合在一個平台中。
  • 命令安全引擎:包含安全策略和基於角色的存取控制,以過濾危險的 AI 生成命令。
  • 本地 AI 支援:支援本地 LLM 部署,將敏感的維運數據保留在企業邊界內。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案