suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
What it solves
ClawProBench は、OpenClaw ランタイム内で動作する AI エージェントの能力を評価するために設計されたベンチマークハーネスです。透明でライブ実行のベンチマークが必要とされる課題に対処し、決定的な採点を用いてモデルが静的データセットではなく実世界タスクでどのようにパフォーマンスを発揮するかを測定します。
How it works
システムはライブファーストのベンチマークハーネスとして動作し、さまざまなシナリオでタスクを実行します。CLI (run.py) を使用してベンチマークプロセスを管理し、インベントリチェック、ドライラン、フル実行を行います。ハーネスは OpenClaw ランタイムと連携してエージェントを実行し、custom_checks にあるシナリオ固有の採点ロジックを適用して成功を判定します。3 回試行する 3-try などのマルチトライ実行をサポートし、pass^3 や pass@3 といった安定性指標を算出します。
Who it’s for
このツールは、エージェント能力を評価し、モデルが OpenClaw エコシステム内でタスクを確実に実行できることを保証したい AI 研究者やモデル開発者向けです。
Highlights
- Live-First Execution: シミュレートされた環境ではなく、実際の OpenClaw ランタイム内でモデルを評価します。
- Deterministic Grading: 構造化レポートとカスタムチェックロジックを使用し、一貫したスコアリングを実現します。
- Comprehensive Profiles: 複数のベンチマークプロファイル (
core,intelligence,coverage,native,full) を提供し、迅速なランキングスイートと拡張された能力テストのバランスを取ります。 - Robust Execution: チェックポイント再開、クロス環境再開、失敗タスクの再キューイングをサポートします。
- Detailed Metrics: 安定した繰り返し成功に重みを置く
FinalScoreを算出し、一度きりの成功よりも高く評価します。