suyoumo/ClawProBench

ClawProBench is a live-first benchmark harness for evaluating LLM agents in the OpenClaw runtime with deterministic grading and repeated-trial reliability.

何を解決するか

ClawProBench は、OpenClaw ランタイム内で動作する AI エージェントの能力を評価するためのベンチマークハーネスです。静的評価から脱却し、実際のランタイム環境でのエージェントの実際のパフォーマンスをテストするため、透明性があり、ライブ実行による評価と決定論的採点を提供します。

動作方法

このシステムは、coreintelligencenative などのベンチマークプロファイルを使用して、AI エージェントをさまざまなシナリオに通します。3回試行(3-try)などのマルチトライアル実行をサポートし、安定性と成功確率を測定します。ハーネスは OpenClaw CLI を介してエージェントの実行を管理し、トレースを追跡し、カスタムチェッカーを含む決定論的採点ロジックを適用して、タスクが成功裏に完了したかどうかを判断します。

対象ユーザー

AI研究者、モデル開発者、エージェントフレームワークを扱う開発者で、ライブランタイムエージェントタスクにおけるモデルのパフォーマンスを厳密にテスト・ランク付けしたい方々に向けられています。

主な特徴

  • ライブ実行最優先:静的データセットではなく、OpenClaw ランタイム内に直接モデルを評価します。
  • 包括的なシナリオセット:6つのドメインにまたがる102のアクティブなシナリオに加え、追加の育成中シナリオも含まれます。
  • 決定論的採点:構造化されたレポートとカスタムチェッカーを使用して、一貫性と再現性のある結果を確保します。
  • 高度なメトリクス:安定した繰り返し成功(pass^3)と全体的な品質を重み付けする FinalScore を実装しています。
  • 耐障害実行:チェックポイント再開と、実行失敗のみを再実行する機能により、評価コストを最適化します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト