langfuse/langfuse
🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23
解決的問題
Langfuse 是一個開源的 LLM 工程平台,旨在幫助團隊協作開發、監控、評估和除錯 AI 應用。它透過提供可觀測性、提示詞管理和系統化評估工具,解決了將 AI 應用從原型推向生產環境過程中的複雜性。
工作原理
Langfuse 透過 SDK (Python, JS/TS) 或針對 LangChain、LlamaIndex 和 OpenAI 等流行框架的自動插樁集成到 AI 應用中。它捕捉 LLM 呼叫、檢索步驟和代理操作的追蹤,並將其在儀表板中視覺化。該平台還提供具有版本控制功能的集中式提示詞管理系統,以及用於測試模型配置的遊樂場。
適用對象
專為需要即時監控其 LLM 驅動的應用、協作迭代提示詞,並使用數據集和基準測試建立嚴格評估流水線的 AI 工程師和開發團隊而構建。
亮點
- LLM 應用可觀測性:透過追蹤功能追蹤並檢查複雜的日誌、用戶會話和內部邏輯(檢索、嵌入)。
- 提示詞管理:集中管理並對提示詞進行版本控制,以便在不增加應用延遲的情況下進行迭代。
- 評估:支援 LLM-as-a-judge、程式碼評估器、手動標註以及自定義 API 驅動的評估流水線。
- 數據集:建立測試集和基準測試,用於持續改進和部署前測試。
- LLM 遊樂場:一個專用的環境,可以直接從追蹤中測試並迭代提示詞和模型配置。
- 靈活的部署:提供託管雲端服務,或透過 Docker Compose、Kubernetes (Helm) 或 Terraform 範本進行自託管。