truera/trulens

Evaluation and Tracking for LLM Experiments and AI Agents

What it solves

TruLens 消除对 LLM 应用“氛围检查”的需求,提供系统化的实验评估与追踪方式。它帮助开发者识别提示词、模型、检索器和知识源的失效模式,让数据驱动的迭代提升应用性能。

How it works

TruLens 使用基于 OpenTelemetry 的插装,将每一次函数调用、LLM 生成和工具调用捕获为结构化的 span。随后对这些 span 应用“反馈函数”和特定评估器(如 RAG Triad)。这些评估可以在应用运行时即时内联执行,或在离线批处理模式下对预先收集的数据集进行,结果可在用户界面中查看。

Who it’s for

它面向构建 LLM 驱动应用的开发者,尤其是使用 RAG(检索增强生成)或代理系统的开发者,需要从零散测试转向严格评估。

Highlights

  • OpenTelemetry Integration: 完全兼容 Jaeger、Grafana Tempo、Datadog 等可观测性工具。
  • Agentic Evaluators: 七个专门指标,用于衡量推理连贯性、计划遵循、工具选择和执行效率。
  • Flexible Evaluation: 同时支持实时内联评估和高吞吐量批处理。
  • Broad Compatibility: 与 LangChain、LlamaIndex 等主流框架集成,支持多家 LLM 提供商,包括 OpenAI、Anthropic、Gemini 和 Bedrock。