truera/trulens

Evaluation and Tracking for LLM Experiments and AI Agents

What it solves

TruLens は LLM アプリケーションの「雰囲気チェック」の必要性を排除し、実験を体系的に評価・追跡する方法を提供します。プロンプト、モデル、リトリーバー、知識ソースの失敗モードを特定し、データ駆動型のイテレーションでアプリケーション性能を向上させます。

How it works

TruLens は OpenTelemetry ベースの計測を用いて、すべての関数呼び出し、LLM 生成、ツール呼び出しを構造化されたスパンとして捕捉します。その後、これらのスパンに「フィードバック関数」や特定の評価器(例:RAG Triad)を適用します。評価はアプリ実行中にインラインで実行することも、事前に収集したデータセットに対してオフラインバッチで実行することもでき、結果は UI で確認できます。

Who it’s for

LLM を活用したアプリケーションを構築する開発者、特に RAG(Retrieval‑Augmented Generation)やエージェントシステムを使用している開発者向けです。逸話的テストから厳密な評価へ移行したい方に最適です。

Highlights

  • OpenTelemetry Integration: Jaeger、Grafana Tempo、Datadog などの可観測性ツールと完全に相互運用可能。
  • Agentic Evaluators: 推論の一貫性、計画遵守、ツール選択、実行効率を測る 7 つの専門メトリクス。
  • Flexible Evaluation: リアルタイムインライン評価と高スループットバッチ処理の両方をサポート。
  • Broad Compatibility: LangChain、LlamaIndex などの主要フレームワークと統合し、OpenAI、Anthropic、Gemini、Bedrock など多数の LLM プロバイダーに対応。