microsoft/OpenRCA

[ICLR'25] OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?

解決的問題

OpenRCA 解決了評估大型語言模型(LLMs)在複雜軟體運行情境中執行根本原因分析(RCA)能力的挑戰。它提供一個標準化的基準測試,用於檢驗模型能否分析龐大的遙測資料,以識別系統故障的原因。

作法

本專案提供一個包含來自不同產業(電信、銀行、市場)遙測資料的資料集,其中包括 KPI 時間序列、依賴關係追蹤圖和半結構化日誌。為了解決這些任務,LLM 必須在不同資料類型之間進行推理,並理解系統依賴關係。

作為基線,專案引入 RCA-agent,該代理使用 Python 進行資料檢索與分析。此方法可防止模型因上下文過長而被壓垮,使其能專注於推理,並擴展至更大規模的遙測資料集。

適用對象

  • 研究 LLM 在技術診斷中推理能力的 AI 研究人員。
  • 建構自動化系統監控與故障排除 AI 代理的開發者。
  • 對基準測試根本原因分析工具感興趣的工程師。

亮點

  • 多模態遙測資料:包含日誌、指標和追蹤,實現全面分析。
  • RCA-agent 基線:基於 Python 的代理,用於檢索與分析資料,以處理大規模遙測資料。
  • 可自訂任務:工具可從既有或私有遙測資料生成新任務。
  • 產業特定資料集:包含電信、銀行和市場領域的場景。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案