qinshihu/itops-agent-platform
China's 1st enterprise multi-agent IT ops platform. LLM-powered auto-remediation for Zabbix/Prometheus. Docker deploy.
解決的問題
ITOps Agent Platform 解決了傳統 IT 維運效率低下和壓力大的問題。該平台將從接收告警到驗證的整個生命週期自動化,將回應時間縮短至 3 分鐘以內,而不是每個事件花費 30-60 分鐘進行手動排障(VPN 登入、SSH、命令列調查)。
工作原理
該平台利用多智能體 AI 系統實現「感知 $\rightarrow$ 診斷 $\rightarrow$ 決策 $\rightarrow$ 執行 $\rightarrow$ 驗證」的閉環工作流:
- 告警集成:透過 Webhooks 從 Prometheus 或 Zabbix 等工具接收告警。
- AI 診斷:多個 AI 智能體協作分析日誌和指標,以尋找根本原因並生成自然語言報告。
- 決策與審批:AI 生成結構化的修復命令和風險評估,並推送到行動應用程式(WeCom、DingTalk)進行人機回環 (HITL) 審批。
- 執行:審批通過後,平台透過 SSH 或 API 執行命令並自動驗證結果。
- 基礎設施管理:提供統一的介面來管理 Docker 容器、VMware/KVM 虛擬機器、Kubernetes 集群和物理數據中心資產(包括 3D 數位雙生)。
適用對象
- 維運工程師 & SRE:消除深夜手動排障和工具切換。
- IT 經理/CTO:從被動的「靠運氣」復原轉向自主的自癒策略。
- 中小企業:作為 PagerDuty、Rundeck 和 Portainer 等昂貴商業套件的免費開源替代方案。
- 安全團隊:確保所有修復操作都經過審計和批准。
亮點
- 多智能體編排:使用 12 個專門的 AI 智能體進行協作推理,而不是單次 LLM 呼叫。
- 全鏈路自動化:實現了從告警到驗證的完整路徑工程實現。
- 人機回環 (HITL):整合的行動審批流程,確保生產環境的安全。
- 統一基礎設施控制:將容器、虛擬機器、K8s 和網路設備管理整合在一個平台中。
- 命令安全引擎:包含安全策略和基於角色的存取控制,以過濾危險的 AI 生成命令。
- 本地 AI 支援:支援本地 LLM 部署,將敏感的維運數據保留在企業邊界內。
相關
- 專案
- 專案
- 專案
- 專案
- 專案