Arize-ai/phoenix
AI Observability & Evaluation
何を解決するか
Arize Phoenix は、OpenTelemetry をベースにしたインストルメンテーションを通じて、LLM アプリケーションのトレース、評価、トラブルシューティングを可能にするオープンソースの AI オブザーバビリティプラットフォームです。複雑な AI ワークフロー内の挙動を理解するという課題に対処し、実行時トレース、パフォーマンスベンチマーク、プロンプト最適化の可視化を提供します。
動作方法
Phoenix は OpenInference プロジェクトを介して OpenTelemetry をベースにしたインストルメンテーションを使用して、LLM アプリケーションの実行時トレースを収集します。ベンダーおよび言語に依存せず、LangGraph、LlamaIndex、CrewAI などの人気フレームワーク、および OpenAI、Anthropic、Google GenAI などの LLM プロバイダーと統合可能です。ローカル、コンテナ、クラウドのいずれでも実行できます。
対象ユーザー
LLM ベースのアプリケーションを開発する AI エンジニアや開発者で、トレースのデバッグ、LLM を用いた評価によるパフォーマンスベンチマーク、プロンプトやモデルの体系的な反復が必要な方々です。
主な特徴
- トレース: OpenTelemetry を使用して LLM アプリケーションの実行時をキャプチャおよび可視化。
- 評価: LLM を使って応答およびリトリーバル評価を通じてパフォーマンスをベンチマーク。
- データセットと実験: プロンプト、LLM、リトリーバル手法の変更を追跡するバージョン管理されたデータセットを作成。
- プレイグラウンド: プロンプトの最適化、モデルの比較、トレースされた LLM 呼び出しの再実行。
- PXI (Phoenix Intelligence): デバッグおよびプロンプトの反復に特化した統合 AI エンジニアリングエージェント。
- リモート MCP サーバー: Claude Code や Cursor などのコードエージェントを Phoenix に直接接続し、トレースやデータセットを照会可能に。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト