Arize-ai/phoenix

AI Observability & Evaluation

解决的问题

Phoenix 解决了 LLM 应用程序监控与优化的难题。它通过追踪提供应用运行时的可见性,通过评估实现性能基准测试,并帮助管理提示词工程(prompt engineering)和实验的迭代过程。

工作原理

Phoenix 使用基于 OpenTelemetry 的插桩技术来追踪 LLM 应用程序的运行时。它利用 LLM 对响应和检索质量进行评估。用户可以为实验创建版本化的数据集,并使用内置的 AI 工程代理 (PXI) 来调试追踪并迭代提示词。它是厂商无关的,支持 LangChain、LlamaIndex 和 CrewAI 等各种框架,以及 OpenAI 和 Anthropic 等提供商。

适用对象

  • 构建和调试 LLM 应用程序的 AI 工程师。
  • 需要对 RAG (检索增强生成) 性能进行基准测试的开发者。
  • 需要系统化提示词管理和版本控制的团队。
  • 希望通过 MCP 查询追踪和数据集的编程代理(如 Cursor 或 Claude Code)用户。

亮点

  • Tracing: 基于 OpenTelemetry 的运行时插桩。
  • Evaluation: 由 LLM 驱动的响应和检索基准测试。
  • Experimentation: 用于跟踪提示词、模型和检索变更的工具。
  • Prompt Management: 带有版本控制和标签的系统化测试。
  • AI Agent Integration: 支持远程 MCP 服务器,用于从编程代理中查询数据。