InternLM/WildClawBench

An in-the-wild benchmark for AI agents in the production harness.

What it solves

WildClawBenchは、単一の機能テスト(単純な関数呼び出しやJSONパースなど)を超え、AIエージェントが複雑でエンドツーエンドの現実世界の業務を遂行できるかどうかを評価するために設計されています。自律的な計画、エラーリカバリ、およびマルチモーダルな合成を必要とする、長期的なタスクを含むライブ環境でのエージェントのテストを通じて、ベンチマークスコアと実際の有用性の間のギャップを埋めることを目的としています。

How it works

エージェントは、Webブラウザ、bash terminal、ファイルシステム、メール、カレンダーなどの実際のツールを備えたパーソナルAIアシスタントフレームワークである、ライブOpenClaw環境にデプロイされます。このベンチマークは、6つのカテゴリ(Productivity, Code Intelligence, Social Interaction, Search & Retrieval, Creative Synthesis, and Safety Alignment)にわたる60個の独自かつ手作りのタスクで構成されています。

再現性を確保し、データ漏洩を防ぐために、各タスクは隔離されたDocker containerで実行されます。このシステムは、4つの異なるエージェント・ハーネス(OpenClaw, Claude Code, Codex CLI, and Hermes Agent)をサポートしており、研究者が基盤となるLLMの能力と、エージェント・フレームワークによって提供されるスキャフォールディング(足場)を区別できるようにしています。

Who it’s for

このツールは、複雑で多段階のワークフローにおけるモデルのパフォーマンスを測定するための、厳格で実用的な方法を必要とする、エージェント型システムを構築しているAI研究者および開発者向けです。

Highlights

  • Real-world environments: 実際のユーザーワークフローをシミュレートするために、モックではなくライブツールを使用します。
  • Long-horizon tasks: 10〜20分間の実行と10〜60回以上のツール呼び出しを伴うワークフローをテストします。
  • Multi-modal evaluation: ビデオ理解、画像生成、およびクロスモーダルな合成を必要とするタスクを含みます。
  • Harness comparison: モデルのパフォーマンスをフレームワークの効率性と分離して評価するために、複数のエージェント・スキャフォールディングをサポートします。
  • Isolated execution: 一貫性と再現性のある結果を確保するために、各タスクにDocker containerを使用します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト