Arize-ai/phoenix

AI Observability & Evaluation

解決的問題

Phoenix 解決了 LLM 應用程式監控與優化的難題。它透過追蹤提供應用程式執行時的能見度,透過評估實現效能基準測試,並協助管理提示詞工程(prompt engineering)與實驗的迭代過程。

工作原理

Phoenix 使用基於 OpenTelemetry 的插樁技術來追蹤 LLM 應用程式的執行時期。它利用 LLM 對回應與檢索品質進行評估。使用者可以為實驗建立版本化的資料集,並使用內建的 AI 工程代理 (PXI) 來除錯追蹤並迭代提示詞。它是廠商無關的,支援 LangChain、LlamaIndex 與 CrewAI 等各種框架,以及 OpenAI 與 Anthropic 等供應商。

適用對象

  • 建置與除錯 LLM 應用程式的 AI 工程師。
  • 需要對 RAG (檢索增強生成) 效能進行基準測試的開發者。
  • 需要系統化提示詞管理與版本控制的團隊。
  • 希望透過 MCP 查詢追蹤與資料集的程式碼代理(如 Cursor 或 Claude Code)使用者。

亮點

  • Tracing: 基於 OpenTelemetry 的執行時期插樁。
  • Evaluation: 由 LLM 驅動的回應與檢索基準測試。
  • Experimentation: 用於追蹤提示詞、模型與檢索變更的工具。
  • Prompt Management: 帶有版本控制與標籤的系統化測試。
  • AI Agent Integration: 支援遠端 MCP 伺服器,用於從程式碼代理中查詢資料。