suyoumo/ClawProBench

ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.

它解決的問題

ClawProBench 是一個設計用於評估 OpenClaw 執行環境中 AI 代理能力的基準測試框架。它解決了對透明、即時執行評估與確定性評分的需求,從靜態評估轉向測試代理在真實執行環境中的實際表現。

如何運作

系統使用一組基準配置檔(例如 coreintelligencenative)來讓 AI 代理執行於各種情境中。支援多輪測試(例如 3 次嘗試)以衡量穩定性與成功率。該框架透過 OpenClaw CLI 管理代理的執行,追蹤執行痕跡,並應用確定性評分邏輯——包含自訂檢查器——以判斷任務是否成功完成。

適用對象

適用於需要嚴格測試與評估其模型在即時執行代理任務中表現的 AI 研究人員、模型開發者,以及使用代理框架的開發者。

主要特色

  • 即時優先執行:直接在 OpenClaw 執行環境中評估模型,而非使用靜態資料集。
  • 全面的情境集合:涵蓋 6 個領域中的 102 個活躍情境,另有額外的孵化中情境。
  • 確定性評分:使用結構化報告與自訂檢查器,確保結果的一致性與可重現性。
  • 進階指標:實作 FinalScore,權重穩定的重複成功(pass^3)與整體品質。
  • 具韌性的執行:支援檢查點恢復與僅重跑執行失敗的案例,以優化評估成本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案