microsoft/OpenRCA
[ICLR'25] OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?
解決的問題
OpenRCA 解決了評估大型語言模型(LLMs)在複雜軟體運行情境中執行根本原因分析(RCA)能力的挑戰。它提供一個標準化的基準測試,用於檢驗模型能否分析龐大的遙測資料,以識別系統故障的原因。
作法
本專案提供一個包含來自不同產業(電信、銀行、市場)遙測資料的資料集,其中包括 KPI 時間序列、依賴關係追蹤圖和半結構化日誌。為了解決這些任務,LLM 必須在不同資料類型之間進行推理,並理解系統依賴關係。
作為基線,專案引入 RCA-agent,該代理使用 Python 進行資料檢索與分析。此方法可防止模型因上下文過長而被壓垮,使其能專注於推理,並擴展至更大規模的遙測資料集。
適用對象
- 研究 LLM 在技術診斷中推理能力的 AI 研究人員。
- 建構自動化系統監控與故障排除 AI 代理的開發者。
- 對基準測試根本原因分析工具感興趣的工程師。
亮點
- 多模態遙測資料:包含日誌、指標和追蹤,實現全面分析。
- RCA-agent 基線:基於 Python 的代理,用於檢索與分析資料,以處理大規模遙測資料。
- 可自訂任務:工具可從既有或私有遙測資料生成新任務。
- 產業特定資料集:包含電信、銀行和市場領域的場景。
相關
- 專案
- 專案
- 專案
- 專案
- 專案