langfuse/langfuse

🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23

해결하는 문제

Langfuse는 팀이 협업하여 AI 애플리케이션을 개발, 모니터링, 평가 및 디버깅할 수 있도록 설계된 오픈 소스 LLM 엔지니어링 플랫폼입니다. 관측성, 프롬프트 관리 및 체계적인 평가를 위한 도구를 제공하여 AI 앱을 프로토타입에서 프로덕션으로 전환할 때 발생하는 복잡성을 해결합니다.

작동 방식

Langfuse는 SDK(Python, JS/TS) 또는 LangChain, LlamaIndex, OpenAI와 같은 인기 있는 프레임워크를 위한 자동 계측을 통해 AI 애플리케이션에 통합됩니다. LLM 호출, 검색 단계 및 에이전트 작업을 캡처하여 대시보드에 시각화합니다. 또한 버전 관리가 포함된 중앙 집중식 프롬프트 관리 시스템과 모델 구성을 테스트하기 위한 플레이그라운드를 제공합니다.

대상

LLM 기반 애플리케이션을 실시간으로 모니터링하고, 프롬프트를 협업하여 반복 개선하며, 데이터 세트와 벤치마크를 사용하여 엄격한 평가 파이프라인을 구축해야 하는 AI 엔지니어 및 개발 팀을 위해 구축되었습니다.

주요 특징

  • LLM 애플리케이션 관측성: 트레이싱을 통해 복잡한 로그, 사용자 세션 및 내부 로직(검색, 임베딩)을 추적하고 검사합니다.
  • 프롬프트 관리: 프롬프트를 중앙에서 관리하고 버전 관리를 수행하여 애플리케이션 지연 시간을 추가하지 않고도 반복 개선을 할 수 있습니다.
  • 평가: LLM-as-a-judge, 코드 평가자, 수동 레이블 지정 및 사용자 정의 API 기반 평가 파이프라인을 지원합니다.
  • 데이터 세트: 지속적인 개선 및 배포 전 테스트를 위한 테스트 세트와 벤치마크를 생성합니다.
  • LLM 플레이그라운드: 트레이스에서 직접 프롬프트와 모델 구성을 테스트하고 반복 개선할 수 있는 전용 환경입니다.
  • 유연한 배포: 관리형 클라우드 서비스 또는 Docker Compose, Kubernetes (Helm), Terraform 템플릿을 통한 셀프 호스팅이 가능합니다.