ongridio/ongrid

An ops AI Agent that understands your infrastructure, finds the root cause, and fixes it — right from Slack, Telegram, Lark or DingTalk.

무엇을 해결하는가

Ongrid는 인프라 문제의 조사 및 해결을 자동화하도록 설계된 AI 기반 운영 에이전트입니다. 시스템 토폴로지 전반의 메트릭, 로그, 트레이스를 상관 분석하여 장애의 정확한 원인을 찾아내고, 종종 특정 코드 라인까지 지목함으로써 근본 원인 분석(RCA)의 수동 작업을 제거합니다.

작동 방식

Ongrid는 코디네이터가 전문 에이전트(SRE, 네트워크 또는 데이터베이스 에이전트 등)에게 작업을 할당하는 계층적 에이전트 시스템을 사용합니다. 관측성 스택(Prometheus, Loki, Tempo, Grafana)과 통합되며, RAG 기반 지식 검색을 사용하여 런북과 장애 이력을 인덱싱합니다. 시스템은 알람이나 Slack 또는 Telegram과 같은 채팅 인터페이스를 통한 사용자 쿼리로 트리거될 수 있으며, 프로덕션 변경 사항이 적용되기 전에 인간의 승인을 받기 위한 "write gate"를 포함합니다.

대상 사용자

Kubernetes 클러스터와 네트워크 장치를 포함한 복잡한 인프라를 관리하며, 자동화된 조사를 통해 평균 복구 시간(MTTR)을 줄이고자 하는 SRE, DevOps 엔지니어 및 플랫폼 운영자를 위해 구축되었습니다.

주요 특징

  • 자동 근본 원인 분석: 관측성 데이터와 토폴로지를 상관 분석하여 알람 뒤에 숨겨진 "왜"를 식별합니다.
  • 멀티 에이전트 아키텍처: 코디네이터와 전문 에이전트를 사용하여 다양한 인프라 도메인을 처리합니다.
  • 채팅으로의 핸드오프: Slack, Telegram 및 기타 IM 채널 내에서 직접 작동합니다.
  • 보안 액세스: 리버스 터널링을 지원하는 브라우저 기반 SSH 셸을 특징으로 하며, 호스트에 인바운드 포트가 필요하지 않습니다.
  • 확장 가능한 툴링: 새로운 운영 도구를 추가하기 위해 MCP 서버와 커스텀 스킬 카탈로그를 지원합니다.
  • Kubernetes 관리: 클러스터 등록, 워크로드 조사 및 라이프사이클 업그레이드를 처리합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트