microsoft/OpenRCA

[ICLR'25] OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?

解决的问题

OpenRCA 解决了评估大型语言模型(LLMs)在复杂软件运行场景中执行根本原因分析(RCA)能力的挑战。它提供了一个标准化的基准测试,用于检验模型能否分析海量的遥测数据,以识别系统故障的原因。

工作原理

该项目提供了一个包含来自不同行业(电信、银行、市场)遥测数据的数据集,其中包括 KPI 时间序列、依赖关系追踪图和半结构化日志。为了解决这些任务,LLM 必须在不同数据类型之间进行推理,并理解系统依赖关系。

作为基线,项目引入了 RCA-agent,该代理使用 Python 进行数据检索和分析。这种方法可防止模型因上下文过长而被压垮,使其能够专注于推理,并扩展到更大规模的遥测数据集。

适用人群

  • 研究 LLM 在技术诊断中推理能力的 AI 研究人员。
  • 构建自动化系统监控和故障排查 AI 代理的开发者。
  • 对基准测试根本原因分析工具感兴趣的工程师。

亮点

  • 多模态遥测数据:包含日志、指标和追踪,实现全面分析。
  • RCA-agent 基线:基于 Python 的代理,用于检索和分析数据,以处理大规模遥测数据。
  • 可自定义任务:工具可从现有或私有遥测数据生成新任务。
  • 行业特定数据集:包含电信、银行和市场领域的场景。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目