microsoft/OpenRCA

[ICLR'25] OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?

해결하는 문제

OpenRCA는 대규모 언어 모델(LLM)이 복잡한 소프트웨어 운영 환경에서 근본 원인 분석(RCA)을 수행할 수 있는지 평가하는 도전 과제를 해결합니다. 방대한 양의 텔레메트리 데이터를 분석하여 시스템 장애의 원인을 식별할 수 있는지 테스트하기 위한 표준화된 벤치마크를 제공합니다.

작동 방식

이 프로젝트는 통신, 은행, 시장 등 다양한 산업의 텔레메트리 데이터를 포함하는 데이터셋을 제공합니다. 이 데이터셋에는 KPI 시계열, 종속성 추적 그래프, 반구조화된 로그가 포함되어 있습니다. 이러한 작업을 해결하기 위해 LLM은 다양한 데이터 유형 간에 추론하고 시스템 종속성을 이해해야 합니다.

기준선으로 프로젝트는 RCA-agent를 도입합니다. 이는 Python을 사용하여 데이터를 검색하고 분석하는 에이전트로, 모델이 지나치게 긴 컨텍스트에 휘둘리지 않도록 하여 추론에 집중하고 더 큰 텔레메트리 데이터셋에 확장할 수 있도록 합니다.

대상 사용자

  • LLM의 기술적 진단에서의 추론 능력을 연구하는 AI 연구자.
  • 자동 시스템 모니터링 및 문제 해결을 위한 AI 에이전트를 개발하는 개발자.
  • 근본 원인 분석 도구의 벤치마크에 관심 있는 엔지니어.

주요 특징

  • 다중 모달 텔레메트리: 포괄적인 분석을 위한 로그, 메트릭, 트레이스 포함.
  • RCA-agent 기준선: 대규모 텔레메트리 데이터를 처리하기 위해 데이터 검색 및 분석을 수행하는 Python 기반 에이전트.
  • 사용자 정의 가능한 작업: 기존 또는 사내 텔레메트리 데이터에서 새로운 작업을 생성할 수 있는 도구.
  • 산업별 데이터셋: 통신, 은행, 시장 부문의 시나리오 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트