JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
解決的問題
Judgeval 為由 LLM 驅動的代理(agents)提供了一個持續改進的技術棧。它能幫助開發者檢測失敗、分析根本原因,並使用生產數據驗證修復方案,確保代理行為能夠得到持續監控與改進。
運作原理
該系統使用基於 OpenTelemetry 的追蹤系統來擷取代理函數的輸入、輸出和 token 使用量。它採用「代理裁判」(agent judges)——即基於提示詞(prompt-based)的評分器,在大規模範圍內評估代理行為。這些裁判可以針對即時生產流量運行,或在歷史追蹤數據上重放以驗證修復方案。此外,它還提供具備伺服器端評分的線上監控功能,當出現退化(regressions)時透過 Slack 通知開發者。
目標對象
正在構建 LLM 驅動應用程式與代理的開發者,他們需要一種方法來追蹤代理的執行路徑,並使用生產數據系統性地評估其性能。
重點功能
- 基於 OpenTelemetry 的追蹤:透過簡單的裝飾器(decorator)為函數進行插樁,以擷取執行數據。
- 代理裁判:使用基於提示詞的評分器來建立代理行為的結構化記錄。
- 線上監控:對即時流量進行伺服器端評分,且對延遲完全沒有影響,並針對退化提供 Slack 警報。
- 廣泛的整合:支援主要的 LLM 提供商(OpenAI, Anthropic, Google GenAI, Together AI)以及 LangGraph 和 Claude Agent SDK 等框架。
- MCP Server:連接到相容 MCP 的 AI 工具,直接在 IDE 或 AI 助手中使用顯示失敗資訊。