JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
何を解決するか
Judgevalは、LLM駆動のエージェントの改善の難しさを解決するために、静的テストセットに頼らず、実際の本番データを使って障害を検出・原因を特定・修正の妥当性を検証する方法を提供します。
動作方法
Python SDKを使用して、OpenTelemetryベースのトレーシングによりエージェント関数をインストルメント化し、入力、出力、トークン使用量をキャプチャします。ユーザーは「エージェントジャッジ」と呼ばれる、プロンプトベースのスコアリングを定義できます。これらのジャッジはライブ本番トラフィック(サーバーサイドで遅延の影響なし)で実行したり、過去のトレースを再再生して、変更が実際に問題を修正しているかを検証できます。
対象ユーザー
LLMエージェントやAIアプリケーションを開発しており、本番環境向けの可観測性、自動評価、エージェント行動の継続的改善ループを必要とする開発者。
特徴
- OpenTelemetry Tracing:
@Tracer.observe()を使用して、既存の可観測性スタックと完全互換。 - Agent Judges: 構造化されたプロンプトベースのスコアリングにより、エージェント行動を時間経過とともにラベル付け・追跡可能。
- オンラインモニタリング: サーバーサイドでライブトラフィックをスコアリングし、レグレッション時にSlack通知。
- 広範な統合: OpenAI、Anthropic、Google GenAI、Together AI、LangGraph、OpenLit、Claude Agent SDK に対応。
- JQL: 特定のトレースやスパンを取得するためのクエリ言語。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト