InternLM/WildClawBench

An in-the-wild benchmark for AI agents in the OpenClaw Environment.

解決する課題

ほとんどのAIエージェントのベンチマークは、JSONの解析や単一の関数呼び出しといった、孤立した能力に焦点を当てています。WildClawBenchは、エージェントをライブ環境に投入し、自律的な計画とエラーリカバリを必要とする複雑で多段階のタスクを実行させることで、実世界におけるエンドツーエンドのエージェンシー(代理実行能力)をテストする必要性に応えます。

仕組み

このベンチマークは、6つのカテゴリ(Productivity, Code, Social, Search, Creative, Safety)にわたる60のハンドメイドタスクを使用し、ライブのOpenClaw環境内で実行されます。Dockerコンテナを利用することで、ブラウザ、bash、ファイルシステムなどの実際のツールを備えた、隔離された再現可能な環境で各タスクが実行されることを保証します。また、モデルの能力を周囲の足場(scaffolding)から分離するために、4つの異なるエージェントハーネス(OpenClaw, Claude Code, Codex CLI, Hermes Agent)をサポートしています。

対象者

単純な指示追従テストではなく、実用的な長期的ワークフローにおいてモデルがどのようにパフォーマンスを発揮するかを測定する必要がある、自律型エージェントを構築するAI研究者や開発者向けに設計されています。

ハイライト

  • 実世界の環境: モックの代わりに、ライブツール(ブラウザ、メール、カレンダー)を使用します。
  • 多様なタスクスイート: ビデオハイライトのクリッピングのようなマルチモーダルタスクや、ドキュメント化されていないコードベースのデバッグのような複雑なコーディングタスクが含まれます。
  • マルチハーネス評価: 異なるエージェントの足場を介して、同じモデルの比較を可能にします。
  • 堅牢性テスト: APIキーの漏洩検知やプロンプトインジェクションへの耐性といった、安全性のアライメントタスクが含まれます。
  • 再現可能な結果: 隔離されたDockerコンテナを使用し、実行後にのみ採点スクリプトを注入することでデータ漏洩を防ぎます。