truera/trulens

Evaluation and Tracking for LLM Experiments and AI Agents

What it solves

TruLens 消除對 LLM 應用「感覺檢查」的需求,提供系統化的實驗評估與追蹤方式。它協助開發者找出提示詞、模型、檢索器與知識來源的失效模式,讓資料驅動的迭代得以提升應用效能。

How it works

TruLens 使用基於 OpenTelemetry 的插裝,將每一次函式呼叫、LLM 產生與工具呼叫捕捉為結構化的 span。接著對這些 span 套用「回饋函式」與特定評估器(例如 RAG Triad)。這些評估可以在應用執行時即時內嵌執行,或在離線批次模式下於預先收集的資料集上執行,結果可於使用者介面中檢視。

Who it’s for

此工具設計給開發 LLM 驅動應用的開發者,特別是使用 RAG(檢索增強生成)或代理系統的開發者,讓他們能從零散測試走向嚴謹評估。

Highlights

  • OpenTelemetry Integration: 完全相容 Jaeger、Grafana Tempo、Datadog 等可觀測性工具。
  • Agentic Evaluators: 七項專門指標,用以衡量推理一致性、計畫遵循、工具選擇與執行效率。
  • Flexible Evaluation: 同時支援即時內嵌評估與高吞吐量批次處理。
  • Broad Compatibility: 可與 LangChain、LlamaIndex 等主流框架整合,並支援多家 LLM 供應商,包括 OpenAI、Anthropic、Gemini 與 Bedrock。