JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
何を解決するか
Judgevalは、LLM駆動のエージェント向けの継続的改善スタックを提供します。開発者が本番データを使用して障害を検出し、根本原因を特定し、修正を検証するのを助け、エージェントの動作が時間とともに監視および改善されることを保証します。
仕組み
このシステムは、OpenTelemetryベースのトレースシステムを使用して、エージェント関数の入力、出力、トークン使用量をキャプチャします。プロンプトベースのスコアラーである「エージェントジャッジ」を採用し、スケールでエージェントの動作を評価します。これらのジャッジは、ライブ本番トラフィックに対して実行したり、過去のトレースを再生して修正を検証したりできます。さらに、サーバーサイドスコアリングによるオンラインモニタリングを提供し、回帰が発生した際にSlackを通じて開発者にアラートを送信します。
対象者
LLM駆動のアプリケーションとエージェントを構築し、本番データを使用してエージェントの実行パスをトレースし、体系的にパフォーマンスを評価する必要がある開発者。
ハイライト
- OpenTelemetryベースのトレース: シンプルなデコレータで関数をインストゥルメントし、実行データをキャプチャします。
- エージェントジャッジ: プロンプトベースのスコアラーを使用して、エージェントの動作の構造化されたレコードを作成します。
- オンラインモニタリング: レイテンシへの影響がゼロのライブトラフィックに対するサーバーサイドスコアリングと、回帰時のSlackアラートを提供します。
- 広範な統合: 主要なLLMプロバイダー(OpenAI, Anthropic, Google GenAI, Together AI)およびLangGraphやClaude Agent SDKなどのフレームワークをサポートします。
- MCPサーバー: MCP互換のAIツールに接続し、IDEまたはAIアシスタント内で直接障害を可視化します。