truera/trulens
Evaluation and Tracking for LLM Experiments and AI Agents
해결하는 문제
TruLens는 AI 에이전트 및 RAG 애플리케이션의 '감각 기반' 평가 문제를 해결합니다. 에이전트가 실패하는 지점을 구조적으로 파악하고, 품질을 희생시키지 않고 비용 절감 기회를 식별하며, 추측을 대체하여 추적 가능하고 측정 가능한 메트릭으로 전환할 수 있도록 합니다.
작동 방식
TruLens는 OpenTelemetry 네이티브 트레이싱을 사용하여 AI 애플리케이션의 모든 단계—함수 호출, LLM 생성, 도구 호출 등—을 구조화된 스팬으로 캡처합니다. 그런 다음 이 트레이스에 "LLM 판사"(피드백 함수)를 적용하여 스코어를 매깁니다. 이러한 평가는 애플리케이션이 작동하는 동안 인라인으로 실행하거나, 데이터셋에 대해 배치 모드로 실행할 수 있습니다.
대상 사용자
질적 감각에서 양적 평가와 버전 비교로 전환해야 하는 에이전트 시스템 및 RAG 애플리케이션을 개발하는 AI 팀과 개발자에게 적합합니다.
주요 특징
- OpenTelemetry 네이티브: OTLP 호환 백엔드(예: Jaeger, Grafana Tempo)로 트레이스를 쉽게 이식 가능합니다.
- 에이전트 평가: 추론의 일관성, 계획 준수, 도구 선택, 실행 효율성 등을 측정하기 위한 7개의 전용 평가기 포함.
- RAG 삼각형: 지지력과 컨텍스트 관련성과 같은 핵심 RAG 평가 개념을 지원합니다.
- 유연한 인스트루멘테이션: 애플리케이션 인스트루멘테이션을 쉽게 하기 위한 데코레이터와 평가 대상이 되는 특정 스팬 속성 선택을 위한 Selector API 제공.
- 광범위한 프로바이더 지원: OpenAI, Google Gemini, AWS Bedrock, Snowflake Cortex 등 주요 LLM 프로바이더와 통합 가능.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트