suyoumo/ClawProBench

ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.

What it solves

ClawProBench は、OpenClaw ランタイム内で動作する AI エージェントの能力を評価するために設計されたベンチマークハーネスです。透明でライブ実行のベンチマークが必要とされる課題に対処し、決定的な採点を用いてモデルが静的データセットではなく実世界タスクでどのようにパフォーマンスを発揮するかを測定します。

How it works

システムはライブファーストのベンチマークハーネスとして動作し、さまざまなシナリオでタスクを実行します。CLI (run.py) を使用してベンチマークプロセスを管理し、インベントリチェック、ドライラン、フル実行を行います。ハーネスは OpenClaw ランタイムと連携してエージェントを実行し、custom_checks にあるシナリオ固有の採点ロジックを適用して成功を判定します。3 回試行する 3-try などのマルチトライ実行をサポートし、pass^3pass@3 といった安定性指標を算出します。

Who it’s for

このツールは、エージェント能力を評価し、モデルが OpenClaw エコシステム内でタスクを確実に実行できることを保証したい AI 研究者やモデル開発者向けです。

Highlights

  • Live-First Execution: シミュレートされた環境ではなく、実際の OpenClaw ランタイム内でモデルを評価します。
  • Deterministic Grading: 構造化レポートとカスタムチェックロジックを使用し、一貫したスコアリングを実現します。
  • Comprehensive Profiles: 複数のベンチマークプロファイル (core, intelligence, coverage, native, full) を提供し、迅速なランキングスイートと拡張された能力テストのバランスを取ります。
  • Robust Execution: チェックポイント再開、クロス環境再開、失敗タスクの再キューイングをサポートします。
  • Detailed Metrics: 安定した繰り返し成功に重みを置く FinalScore を算出し、一度きりの成功よりも高く評価します。