truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
What it solves
TruLens는 LLM 애플리케이션에 대한 "분위기 체크"를 없애고, 실험을 체계적으로 평가하고 추적하는 방법을 제공합니다. 프롬프트, 모델, 리트리버, 지식 소스의 실패 모드를 식별하여 데이터 기반 반복을 통해 애플리케이션 성능을 향상시킵니다.
How it works
TruLens는 OpenTelemetry 기반 계측을 사용해 모든 함수 호출, LLM 생성, 도구 호출을 구조화된 span으로 캡처합니다. 그런 다음 이러한 span에 "피드백 함수"와 특정 평가자(예: RAG Triad)를 적용합니다. 평가는 앱이 실행되는 동안 인라인으로 실행하거나, 사전에 수집된 데이터셋에 대해 오프라인 배치 모드로 실행할 수 있으며, 결과는 사용자 인터페이스에서 확인할 수 있습니다.
Who it’s for
LLM 기반 애플리케이션을 구축하는 개발자를 위해 설계되었으며, 특히 RAG(검색 강화 생성) 또는 에이전트 시스템을 사용하는 개발자들이 일화적인 테스트를 넘어 엄격한 평가로 전환할 때 유용합니다.
Highlights
- OpenTelemetry Integration: Jaeger, Grafana Tempo, Datadog 등 관측 도구와 완전 호환.
- Agentic Evaluators: 추론 일관성, 계획 준수, 도구 선택 및 실행 효율성을 측정하는 7가지 특화 메트릭.
- Flexible Evaluation: 실시간 인라인 평가와 고처리량 배치 처리를 모두 지원.
- Broad Compatibility: LangChain, LlamaIndex 등 주요 프레임워크와 통합되고, OpenAI, Anthropic, Gemini, Bedrock 등 다양한 LLM 제공자를 지원합니다.