JudgmentLabs/judgeval
The Continuous-Improvement Stack for Agents. Our environment data and evals power agent improvement and monitoring.
解決的問題
Judgeval 透過提供一種方法,利用真實生產資料而非依賴靜態測試集,來偵測失敗、分析根本原因並驗證修復方案,解決了 LLM 驅動的代理改善困難的問題。
工作原理
它使用 Python SDK 透過基於 OpenTelemetry 的追蹤來對代理函數進行插桩,捕獲輸入、輸出和 token 使用情況。使用者可以定義「代理評判者」——基於提示的評分器,用於大規模評估代理行為。這些評判者可針對即時生產流量執行(伺服器端執行,無延遲影響),或在歷史追蹤資料上重播,以驗證變更是否真正解決了已識別的問題。
適用對象
需要生產級可觀測性、自動化評估以及代理行為持續改進循環的 LLM 代理與 AI 應用開發者。
核心亮點
- OpenTelemetry 追蹤:與現有可觀測性堆疊完全相容,使用
@Tracer.observe()。 - 代理評判者:結構化、基於提示的評分機制,用於隨時間追蹤和標記代理行為。
- 線上監控:伺服器端對即時流量進行評分,並在出現回退時透過 Slack 發送警告。
- 廣泛整合:原生支援 OpenAI、Anthropic、Google GenAI、Together AI、LangGraph、OpenLit 和 Claude Agent SDK。
- JQL:用於檢索特定追蹤和跨度的查詢語言。
相關
- 專案
- 專案
- 專案
- 專案
- 專案