microsoft/OpenRCA

[ICLR'25] OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?

何を解決するか

OpenRCAは、大規模言語モデル(LLM)が複雑なソフトウェア運用環境で根本原因分析(RCA)を実行できるかどうかを評価する課題に対処します。広範なテレメトリデータを分析してシステム障害の原因を特定できるかをテストするための標準化されたベンチマークを提供します。

動作方法

このプロジェクトは、通信、銀行、市場など異なる業界からのテレメトリデータを含むデータセットを提供しています。これにはKPIの時系列データ、依存関係トレースグラフ、および準構造化ログが含まれます。これらのタスクを解決するには、LLMがこれらの異なるデータタイプ間で推論し、システムの依存関係を理解する必要があります。

ベースラインとして、プロジェクトはRCA-agentを導入しています。これはPythonでデータ取得と分析を行うエージェントであり、モデルが長すぎるコンテキストに圧倒されるのを防ぎ、推論に集中し、より大規模なテレメトリデータセットにスケーリングできるようにします。

対象ユーザー

  • LLMの技術的診断における推論能力を研究するAI研究者。
  • 自動システム監視およびトラブルシューティング用AIエージェントを開発する開発者。
  • 根本原因分析ツールのベンチマークに興味を持つエンジニア。

特徴

  • マルチモーダルテレメトリ: 統合的な分析のためのログ、メトリクス、トレースを含む。
  • RCA-agentベースライン: 大規模テレメトリを扱うためにデータの取得と分析を行うPythonベースのエージェント。
  • カスタマイズ可能なタスク: 既存またはプライベートのテレメトリデータから新しいタスクを生成するためのツール。
  • 業界固有のデータセット: 通信、銀行、市場セクターのシナリオを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト