agentscope-ai/OpenJudge

OpenJudge: A Unified Framework for Holistic Evaluation and Quality Rewards

解決的問題

OpenJudge 是一個開源評估框架,旨在透過系統化的評估工作流程,協助開發者改善 AI 應用程式(如聊天機器人與 AI 代理)。它解決了定義品質指標的困難,以及在大規模下執行評估以識別弱點並迭代優化應用程式效能的挑戰。

工作原理

OpenJudge 提供了涵蓋通用、代理專用與多模態領域的 50 多個生產就緒的評分器(graders)。使用者可透過四種不同方法建立評分器:

  • 自訂:透過 Python 接口或提示範本定義規則。
  • 零樣本評估標準生成:使用 LLM 從任務描述中自動產生評估標準。
  • 資料驅動的評估標準生成:使用 GraderGenerator 從標註資料中總結評估標準。
  • 訓練裁判模型:在提示不足的複雜情境中,訓練專用模型。

結果可聚合為整體分數,並整合至 LangSmith 與 Langfuse 等可觀測性平台,或透過 VERL 等框架用作強化學習訓練的獎勵信號。

適用對象

適用於正在開發與優化 LLM 驅動應用程式與代理的開發者與 AI 研究人員,特別是需要專業、可擴展方式評估品質並產生微調獎勵信號的使用者。

核心亮點

  • 全面的評分器庫:包含 50 多個經過驗證的評分器,涵蓋語意品質、代理軌跡、工具呼叫與圖文一致性等。
  • 彈性評估標準生成:支援零樣本與資料驅動的評估標準生成。
  • 整合生態系:與 LangSmith、Langfuse 和 VERL 無縫整合。
  • 線上沙盒環境:無需安裝的瀏覽器介面,可測試評分器並建立評估標準。
  • 代理全生命週期評估:不僅評估最終輸出,還評估整個流程,包含記憶、反思與工具使用。

相關

  • 專案
  • 專案
  • 專案
  • Dispatch
  • 專案