langfuse/langfuse
🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK, LiteLLM, and more. 🍊YC W23
解决的问题
Langfuse 是一个开源的 LLM 工程平台,旨在帮助团队协作开发、监控、评估和调试 AI 应用。它通过提供可观测性、提示词管理和系统化评估工具,解决了将 AI 应用从原型推向生产环境过程中的复杂性。
工作原理
Langfuse 通过 SDK (Python, JS/TS) 或针对 LangChain、LlamaIndex 和 OpenAI 等流行框架的自动插桩集成到 AI 应用中。它捕获 LLM 调用、检索步骤和代理操作的追踪,并将其在仪表板中可视化。该平台还提供具有版本控制功能的集中式提示词管理系统,以及用于测试模型配置的游乐场。
适用对象
专为需要实时监控其 LLM 驱动的应用、协作迭代提示词,并使用数据集和基准测试建立严格评估流水线的 AI 工程师和开发团队而构建。
亮点
- LLM 应用可观测性:通过追踪功能跟踪并检查复杂的日志、用户会话和内部逻辑(检索、嵌入)。
- 提示词管理:集中管理并对提示词进行版本控制,以便在不增加应用延迟的情况下进行迭代。
- 评估:支持 LLM-as-a-judge、代码评估器、手动标注以及自定义 API 驱动的评估流水线。
- 数据集:创建测试集和基准测试,用于持续改进和部署前测试。
- LLM 游乐场:一个专门的环境,可以直接从追踪中测试并迭代提示词和模型配置。
- 灵活的部署:提供托管云服务,或通过 Docker Compose、Kubernetes (Helm) 或 Terraform 模板进行自托管。