Arize-ai/phoenix
AI Observability & Evaluation
解决的问题
Arize Phoenix 是一个基于 OpenTelemetry 的开源 AI 可观测性平台,帮助开发者对 LLM 应用进行追踪、评估和故障排查。它解决了理解复杂 AI 工作流内部行为的挑战,提供了运行时追踪、性能基准测试以及提示词优化的可视化能力。
如何工作
Phoenix 通过 OpenInference 项目使用基于 OpenTelemetry 的仪器化来捕获 LLM 应用的运行时追踪。它与供应商和语言无关,可与 LangGraph、LlamaIndex、CrewAI 等流行框架,以及 OpenAI、Anthropic、Google GenAI 等 LLM 提供商集成。该平台可本地运行、容器化部署或在云端运行。
适用人群
需要调试追踪、使用基于 LLM 的评估进行性能基准测试,并系统性地迭代提示词和模型的 AI 工程师和开发者。
主要亮点
- 追踪:使用 OpenTelemetry 捕获并可视化 LLM 应用的运行时行为。
- 评估:使用 LLM 通过响应和检索评估来基准测试性能。
- 数据集与实验:创建版本化的数据集,以追踪提示词、LLM 和检索方法的变更。
- 沙盒环境:优化提示词、比较模型,并重放已追踪的 LLM 调用。
- PXI(Phoenix Intelligence):集成的 AI 工程代理,用于调试和提示词迭代。
- 远程 MCP 服务器:将 Claude Code、Cursor 等编码代理直接连接到 Phoenix,以查询追踪记录和数据集。
相关
- 项目
- 项目
- 项目
- 项目
- 项目