Arize-ai/phoenix
AI Observability & Evaluation
解决的问题
Phoenix 解决了 LLM 应用程序监控与优化的难题。它通过追踪提供应用运行时的可见性,通过评估实现性能基准测试,并帮助管理提示词工程(prompt engineering)和实验的迭代过程。
工作原理
Phoenix 使用基于 OpenTelemetry 的插桩技术来追踪 LLM 应用程序的运行时。它利用 LLM 对响应和检索质量进行评估。用户可以为实验创建版本化的数据集,并使用内置的 AI 工程代理 (PXI) 来调试追踪并迭代提示词。它是厂商无关的,支持 LangChain、LlamaIndex 和 CrewAI 等各种框架,以及 OpenAI 和 Anthropic 等提供商。
适用对象
- 构建和调试 LLM 应用程序的 AI 工程师。
- 需要对 RAG (检索增强生成) 性能进行基准测试的开发者。
- 需要系统化提示词管理和版本控制的团队。
- 希望通过 MCP 查询追踪和数据集的编程代理(如 Cursor 或 Claude Code)用户。
亮点
- Tracing: 基于 OpenTelemetry 的运行时插桩。
- Evaluation: 由 LLM 驱动的响应和检索基准测试。
- Experimentation: 用于跟踪提示词、模型和检索变更的工具。
- Prompt Management: 带有版本控制和标签的系统化测试。
- AI Agent Integration: 支持远程 MCP 服务器,用于从编程代理中查询数据。