JudgmentLabs/judgeval

The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.

何を解決するか

Judgevalは、LLM駆動のエージェントの改善の難しさを解決するために、静的テストセットに頼らず、実際の本番データを使って障害を検出・原因を特定・修正の妥当性を検証する方法を提供します。

動作方法

Python SDKを使用して、OpenTelemetryベースのトレーシングによりエージェント関数をインストルメント化し、入力、出力、トークン使用量をキャプチャします。ユーザーは「エージェントジャッジ」と呼ばれる、プロンプトベースのスコアリングを定義できます。これらのジャッジはライブ本番トラフィック(サーバーサイドで遅延の影響なし)で実行したり、過去のトレースを再再生して、変更が実際に問題を修正しているかを検証できます。

対象ユーザー

LLMエージェントやAIアプリケーションを開発しており、本番環境向けの可観測性、自動評価、エージェント行動の継続的改善ループを必要とする開発者。

特徴

  • OpenTelemetry Tracing: @Tracer.observe() を使用して、既存の可観測性スタックと完全互換。
  • Agent Judges: 構造化されたプロンプトベースのスコアリングにより、エージェント行動を時間経過とともにラベル付け・追跡可能。
  • オンラインモニタリング: サーバーサイドでライブトラフィックをスコアリングし、レグレッション時にSlack通知。
  • 広範な統合: OpenAI、Anthropic、Google GenAI、Together AI、LangGraph、OpenLit、Claude Agent SDK に対応。
  • JQL: 特定のトレースやスパンを取得するためのクエリ言語。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト