suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
它解決的問題
ClawProBench 是一個設計用於評估 OpenClaw 執行環境中 AI 代理能力的基準測試框架。它解決了對透明、即時執行評估與確定性評分的需求,從靜態評估轉向測試代理在真實執行環境中的實際表現。
如何運作
系統使用一組基準配置檔(例如 core、intelligence 和 native)來讓 AI 代理執行於各種情境中。支援多輪測試(例如 3 次嘗試)以衡量穩定性與成功率。該框架透過 OpenClaw CLI 管理代理的執行,追蹤執行痕跡,並應用確定性評分邏輯——包含自訂檢查器——以判斷任務是否成功完成。
適用對象
適用於需要嚴格測試與評估其模型在即時執行代理任務中表現的 AI 研究人員、模型開發者,以及使用代理框架的開發者。
主要特色
- 即時優先執行:直接在 OpenClaw 執行環境中評估模型,而非使用靜態資料集。
- 全面的情境集合:涵蓋 6 個領域中的 102 個活躍情境,另有額外的孵化中情境。
- 確定性評分:使用結構化報告與自訂檢查器,確保結果的一致性與可重現性。
- 進階指標:實作
FinalScore,權重穩定的重複成功(pass^3)與整體品質。 - 具韌性的執行:支援檢查點恢復與僅重跑執行失敗的案例,以優化評估成本。
相關
- 專案
- 專案
- 專案
- 專案
- 專案