Arize-ai/phoenix

AI Observability & Evaluation

解决的问题

Arize Phoenix 是一个基于 OpenTelemetry 的开源 AI 可观测性平台,帮助开发者对 LLM 应用进行追踪、评估和故障排查。它解决了理解复杂 AI 工作流内部行为的挑战,提供了运行时追踪、性能基准测试以及提示词优化的可视化能力。

如何工作

Phoenix 通过 OpenInference 项目使用基于 OpenTelemetry 的仪器化来捕获 LLM 应用的运行时追踪。它与供应商和语言无关,可与 LangGraph、LlamaIndex、CrewAI 等流行框架,以及 OpenAI、Anthropic、Google GenAI 等 LLM 提供商集成。该平台可本地运行、容器化部署或在云端运行。

适用人群

需要调试追踪、使用基于 LLM 的评估进行性能基准测试,并系统性地迭代提示词和模型的 AI 工程师和开发者。

主要亮点

  • 追踪:使用 OpenTelemetry 捕获并可视化 LLM 应用的运行时行为。
  • 评估:使用 LLM 通过响应和检索评估来基准测试性能。
  • 数据集与实验:创建版本化的数据集,以追踪提示词、LLM 和检索方法的变更。
  • 沙盒环境:优化提示词、比较模型,并重放已追踪的 LLM 调用。
  • PXI(Phoenix Intelligence):集成的 AI 工程代理,用于调试和提示词迭代。
  • 远程 MCP 服务器:将 Claude Code、Cursor 等编码代理直接连接到 Phoenix,以查询追踪记录和数据集。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目