suyoumo/ClawProBench

ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.

What it solves

ClawProBench 是一個基準測試框架,旨在評估在 OpenClaw 執行環境中運行的 AI 代理的能力。它解決了需要透明、即時執行基準測試的問題,使用確定性評分來衡量模型在真實任務上的表現,而非僅僅依賴靜態資料集。

How it works

系統作為即時優先的基準測試框架運作,會在各種情境下執行任務。它使用 CLI (run.py) 來管理基準測試流程,包括清單檢查、乾跑以及完整執行。該框架會橋接至 OpenClaw 執行環境以運行代理,然後套用位於 custom_checks 中的情境特定評分邏輯來判斷成功與否。它支援多次試驗執行(例如 3 次嘗試)以計算穩定性指標,如 pass^3pass@3

Who it’s for

此工具適用於需要評估代理能力並確保其模型能在 OpenClaw 生態系統中可靠執行任務的 AI 研究者與模型開發者。

Highlights

  • Live-First Execution: 評估模型於實際的 OpenClaw 執行環境中,而非使用模擬環境。
  • Deterministic Grading: 使用結構化報告與自訂檢查邏輯,確保評分一致。
  • Comprehensive Profiles: 提供多種基準測試配置 (core, intelligence, coverage, native, full),在快速排名套件與擴展能力測試之間取得平衡。
  • Robust Execution: 支援檢查點恢復、跨環境恢復,以及重新排隊執行失敗的任務。
  • Detailed Metrics: 計算 FinalScore,對穩定的重複成功給予較高權重,而非一次性成功。