Arize-ai/phoenix

AI Observability & Evaluation

解決的問題

Arize Phoenix 是一個基於 OpenTelemetry 的開源 AI 可觀測性平台,協助開發者追蹤、評估與診斷 LLM 應用。它解決了理解複雜 AI 工作流程內部行為的挑戰,提供執行時追蹤、效能基準測試與提示詞優化可視化能力。

如何運作

Phoenix 透過 OpenInference 專案使用 OpenTelemetry 基礎的儀器化,來捕捉 LLM 應用的執行時追蹤。它與供應商及語言無關,可與 LangGraph、LlamaIndex、CrewAI 等流行框架,以及 OpenAI、Anthropic、Google GenAI 等 LLM 提供商整合。平台可於本機、容器或雲端執行。

適用對象

需要調試追蹤、使用基於 LLM 的評估進行效能基準測試,並系統性地迭代提示詞與模型的 AI 工程師與開發者。

主要亮點

  • 追蹤:使用 OpenTelemetry 捕獲並視覺化 LLM 應用的執行時行為。
  • 評估:使用 LLM 透過回應與檢索評估來基準測試效能。
  • 資料集與實驗:建立版本化的資料集,以追蹤提示詞、LLM 與檢索方法的變更。
  • 沙盒環境:優化提示詞、比較模型,並重播已追蹤的 LLM 呼叫。
  • PXI(Phoenix Intelligence):整合的 AI 工程代理,用於除錯與提示詞迭代。
  • 遠端 MCP 伺服器:將 Claude Code、Cursor 等編碼代理直接連接到 Phoenix,以查詢追蹤記錄與資料集。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案