langfuse/langfuse

🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23

解決する課題

Langfuseは、チームが協力してAIアプリケーションを開発、モニタリング、評価、デバッグできるように設計されたオープンソースのLLMエンジニアリングプラットフォームです。観測性、プロンプト管理、および体系的な評価のためのツールを提供することで、AIアプリをプロトタイプから本番環境へ移行する際の複雑さに対処します。

仕組み

Langfuseは、SDK(Python, JS/TS)またはLangChain、LlamaIndex、OpenAIなどの主要なフレームワーク向けの自動インストルメンテーションを介してAIアプリケーションに統合されます。LLM呼び出し、検索ステップ、エージェントのアクションのトレースをキャプチャし、それらをダッシュボードに可視化します。また、バージョン管理機能を備えた集中型プロンプト管理システムと、モデル構成をテストするためのプレイグラウンドも提供します。

対象者

LLMを活用したアプリケーションをリアルタイムでモニタリングし、プロンプトを共同で反復改善し、データセットやベンチマークを使用して厳格な評価パイプラインを構築する必要があるAIエンジニアや開発チーム向けに構築されています。

ハイライト

  • LLMアプリケーションの観測性: トレースを通じて、複雑なログ、ユーザーセッション、および内部ロジック(検索、埋め込み)を追跡および検査します。
  • プロンプト管理: プロンプトを中央で管理し、バージョン管理を行うことで、アプリケーションのレイテンシを増やすことなく反復改善を可能にします。
  • 評価: LLM-as-a-judge、コード評価者、手動ラベル付け、およびカスタムAPI駆動の評価パイプラインをサポートします。
  • データセット: 継続的な改善とデプロイ前のテストのために、テストセットとベンチマークを作成します。
  • LLMプレイグラウンド: トレースから直接プロンプトやモデル構成をテストおよび反復改善するための専用環境です。
  • 柔軟なデプロイ: マネージドクラウドサービスとして、またはDocker Compose、Kubernetes (Helm)、Terraformテンプレートを介したセルフホストとして利用可能です。