truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
何を解決するか
TruLensは、AIエージェントおよびRAGアプリケーションの「感覚ベース」評価という問題を解決します。構造的な方法でエージェントの失敗箇所を特定し、品質を損なわずにコスト削減の機会を発見し、推測ではなくトレーサブルで測定可能なメトリクスに置き換えます。
動作方法
TruLensはOpenTelemetryネイティブなトレーシングを使用して、AIアプリケーションのすべてのステップ(関数呼び出し、LLM生成、ツール呼び出しなど)を構造化されたスパンとしてキャプチャします。その後、「LLMジャッジ」(フィードバック関数)を適用してこれらのトレースをスコア付けします。これらの評価はアプリケーションの実行中にインラインで実行することも、データセット上でバッチモードで実行することも可能です。
対象ユーザー
構造的な評価とバージョン比較に移行したい、エージェントシステムおよびRAGアプリケーションを開発するAIチームや開発者向けに設計されています。
主な特徴
- OpenTelemetryネイティブ: トレースはJaegerやGrafana Tempoなど、OTLP互換バックエンドにポータブルです。
- エージェント評価: 推論の整合性、計画の遵守、ツール選択、実行効率を測定するための7つの専用評価関数を含みます。
- RAG三要素: 基盤性とコンテキストの関連性といった、RAG評価の基本概念をサポートします。
- 柔軟なインストルメンテーション: シンプルなアプリケーションインストルメンテーションのためのデコレーターと、評価対象の特定スパン属性を指定するためのSelector APIを提供します。
- 広範なプロバイダ対応: OpenAI、Google Gemini、AWS Bedrock、Snowflake Cortexなど、主要なLLMプロバイダと統合可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト