suyoumo/ClawProBench
ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.
何を解決するか
ClawProBench は、OpenClaw ランタイム内で動作する AI エージェントの能力を評価するためのベンチマークハーネスです。静的評価から脱却し、実際のランタイム環境でのエージェントの実際のパフォーマンスをテストするため、透明性があり、ライブ実行による評価と決定論的採点を提供します。
動作方法
このシステムは、core、intelligence、native などのベンチマークプロファイルを使用して、AI エージェントをさまざまなシナリオに通します。3回試行(3-try)などのマルチトライアル実行をサポートし、安定性と成功確率を測定します。ハーネスは OpenClaw CLI を介してエージェントの実行を管理し、トレースを追跡し、カスタムチェッカーを含む決定論的採点ロジックを適用して、タスクが成功裏に完了したかどうかを判断します。
対象ユーザー
AI研究者、モデル開発者、エージェントフレームワークを扱う開発者で、ライブランタイムエージェントタスクにおけるモデルのパフォーマンスを厳密にテスト・ランク付けしたい方々に向けられています。
主な特徴
- ライブ実行最優先:静的データセットではなく、OpenClaw ランタイム内に直接モデルを評価します。
- 包括的なシナリオセット:6つのドメインにまたがる102のアクティブなシナリオに加え、追加の育成中シナリオも含まれます。
- 決定論的採点:構造化されたレポートとカスタムチェッカーを使用して、一貫性と再現性のある結果を確保します。
- 高度なメトリクス:安定した繰り返し成功(pass^3)と全体的な品質を重み付けする
FinalScoreを実装しています。 - 耐障害実行:チェックポイント再開と、実行失敗のみを再実行する機能により、評価コストを最適化します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト