Arize-ai/phoenix
AI Observability & Evaluation
解決的問題
Phoenix 解決了 LLM 應用程式監控與優化的難題。它透過追蹤提供應用程式執行時的能見度,透過評估實現效能基準測試,並協助管理提示詞工程(prompt engineering)與實驗的迭代過程。
工作原理
Phoenix 使用基於 OpenTelemetry 的插樁技術來追蹤 LLM 應用程式的執行時期。它利用 LLM 對回應與檢索品質進行評估。使用者可以為實驗建立版本化的資料集,並使用內建的 AI 工程代理 (PXI) 來除錯追蹤並迭代提示詞。它是廠商無關的,支援 LangChain、LlamaIndex 與 CrewAI 等各種框架,以及 OpenAI 與 Anthropic 等供應商。
適用對象
- 建置與除錯 LLM 應用程式的 AI 工程師。
- 需要對 RAG (檢索增強生成) 效能進行基準測試的開發者。
- 需要系統化提示詞管理與版本控制的團隊。
- 希望透過 MCP 查詢追蹤與資料集的程式碼代理(如 Cursor 或 Claude Code)使用者。
亮點
- Tracing: 基於 OpenTelemetry 的執行時期插樁。
- Evaluation: 由 LLM 驅動的回應與檢索基準測試。
- Experimentation: 用於追蹤提示詞、模型與檢索變更的工具。
- Prompt Management: 帶有版本控制與標籤的系統化測試。
- AI Agent Integration: 支援遠端 MCP 伺服器,用於從程式碼代理中查詢資料。