Arize-ai/phoenix
AI Observability & Evaluation
解決的問題
Arize Phoenix 是一個基於 OpenTelemetry 的開源 AI 可觀測性平台,協助開發者追蹤、評估與診斷 LLM 應用。它解決了理解複雜 AI 工作流程內部行為的挑戰,提供執行時追蹤、效能基準測試與提示詞優化可視化能力。
如何運作
Phoenix 透過 OpenInference 專案使用 OpenTelemetry 基礎的儀器化,來捕捉 LLM 應用的執行時追蹤。它與供應商及語言無關,可與 LangGraph、LlamaIndex、CrewAI 等流行框架,以及 OpenAI、Anthropic、Google GenAI 等 LLM 提供商整合。平台可於本機、容器或雲端執行。
適用對象
需要調試追蹤、使用基於 LLM 的評估進行效能基準測試,並系統性地迭代提示詞與模型的 AI 工程師與開發者。
主要亮點
- 追蹤:使用 OpenTelemetry 捕獲並視覺化 LLM 應用的執行時行為。
- 評估:使用 LLM 透過回應與檢索評估來基準測試效能。
- 資料集與實驗:建立版本化的資料集,以追蹤提示詞、LLM 與檢索方法的變更。
- 沙盒環境:優化提示詞、比較模型,並重播已追蹤的 LLM 呼叫。
- PXI(Phoenix Intelligence):整合的 AI 工程代理,用於除錯與提示詞迭代。
- 遠端 MCP 伺服器:將 Claude Code、Cursor 等編碼代理直接連接到 Phoenix,以查詢追蹤記錄與資料集。
相關
- 專案
- 專案
- 專案
- 專案
- 專案