Arize-ai/phoenix

AI Observability & Evaluation

何を解決するか

Arize Phoenix は、OpenTelemetry をベースにしたインストルメンテーションを通じて、LLM アプリケーションのトレース、評価、トラブルシューティングを可能にするオープンソースの AI オブザーバビリティプラットフォームです。複雑な AI ワークフロー内の挙動を理解するという課題に対処し、実行時トレース、パフォーマンスベンチマーク、プロンプト最適化の可視化を提供します。

動作方法

Phoenix は OpenInference プロジェクトを介して OpenTelemetry をベースにしたインストルメンテーションを使用して、LLM アプリケーションの実行時トレースを収集します。ベンダーおよび言語に依存せず、LangGraph、LlamaIndex、CrewAI などの人気フレームワーク、および OpenAI、Anthropic、Google GenAI などの LLM プロバイダーと統合可能です。ローカル、コンテナ、クラウドのいずれでも実行できます。

対象ユーザー

LLM ベースのアプリケーションを開発する AI エンジニアや開発者で、トレースのデバッグ、LLM を用いた評価によるパフォーマンスベンチマーク、プロンプトやモデルの体系的な反復が必要な方々です。

主な特徴

  • トレース: OpenTelemetry を使用して LLM アプリケーションの実行時をキャプチャおよび可視化。
  • 評価: LLM を使って応答およびリトリーバル評価を通じてパフォーマンスをベンチマーク。
  • データセットと実験: プロンプト、LLM、リトリーバル手法の変更を追跡するバージョン管理されたデータセットを作成。
  • プレイグラウンド: プロンプトの最適化、モデルの比較、トレースされた LLM 呼び出しの再実行。
  • PXI (Phoenix Intelligence): デバッグおよびプロンプトの反復に特化した統合 AI エンジニアリングエージェント。
  • リモート MCP サーバー: Claude Code や Cursor などのコードエージェントを Phoenix に直接接続し、トレースやデータセットを照会可能に。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト