truera/trulens

Evaluation and Tracking for LLM Experiments and AI Agents

何を解決するか

TruLensは、AIエージェントおよびRAGアプリケーションの「感覚ベース」評価という問題を解決します。構造的な方法でエージェントの失敗箇所を特定し、品質を損なわずにコスト削減の機会を発見し、推測ではなくトレーサブルで測定可能なメトリクスに置き換えます。

動作方法

TruLensはOpenTelemetryネイティブなトレーシングを使用して、AIアプリケーションのすべてのステップ(関数呼び出し、LLM生成、ツール呼び出しなど)を構造化されたスパンとしてキャプチャします。その後、「LLMジャッジ」(フィードバック関数)を適用してこれらのトレースをスコア付けします。これらの評価はアプリケーションの実行中にインラインで実行することも、データセット上でバッチモードで実行することも可能です。

対象ユーザー

構造的な評価とバージョン比較に移行したい、エージェントシステムおよびRAGアプリケーションを開発するAIチームや開発者向けに設計されています。

主な特徴

  • OpenTelemetryネイティブ: トレースはJaegerやGrafana Tempoなど、OTLP互換バックエンドにポータブルです。
  • エージェント評価: 推論の整合性、計画の遵守、ツール選択、実行効率を測定するための7つの専用評価関数を含みます。
  • RAG三要素: 基盤性とコンテキストの関連性といった、RAG評価の基本概念をサポートします。
  • 柔軟なインストルメンテーション: シンプルなアプリケーションインストルメンテーションのためのデコレーターと、評価対象の特定スパン属性を指定するためのSelector APIを提供します。
  • 広範なプロバイダ対応: OpenAI、Google Gemini、AWS Bedrock、Snowflake Cortexなど、主要なLLMプロバイダと統合可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト