xlang-ai/OSWorld-V2

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

何を解決するか

OSWorld-V2 は、AIエージェントが「コンピュータの使用」を実行できるかどうかを評価するための標準化されたベンチマークと環境を提供します。長期間にわたる現実世界のタスクを、ブラウザ、アプリケーション、ファイルシステムを含む完全なオペレーティングシステムとやり取りする必要があるため、テストが困難である問題に対処しています。また、タスク定義とアセットを制限することで、ベンチマークの漏洩を防ぎます。

動作方法

このプロジェクトは、DockerまたはAWSを介して制御された仮想マシン(VM)環境を作成し、エージェントがアクションを実行できるようにします。目的を定義し、成功を評価するために、Hugging Faceにホストされたゲート付きPythonタスククラスとアセットを使用します。現実性と安定性を確保するために、モックされたウェブサイトと特定のタスク用に自己ホストされたGitLabインスタンスを採用しています。システムは複数環境での並列実行をサポートし、手動でのタスク検査やトラジェクトリ記録のためのツールも提供します。

対象ユーザー

マルチモーダルエージェントを構築しているAI研究者や開発者向けです。これらのエージェントはスクリーンの内容(スクリーンショットを介して)を認識し、コンピュータインターフェースとやり取りして、複雑なマルチステップワークフローを完了できる必要があります。

特徴

  • 現実世界のシミュレーション:単純化されたAPIではなく、実際のOS環境でエージェントをテストします。
  • 漏洩防止:タスククラスとアセットは、Hugging Faceのゲート付きデータセットを通じて配布され、エージェントが訓練データ内で答えを見つけることを防ぎます。
  • 柔軟なインフラ:ローカルのDockerデプロイメントとスケーラブルなAWSベースの並列評価の両方をサポートします。
  • 包括的なツールキット:トラジェクトリビューア、手動検査スクリプト、OSWorld 1.0から移行するエージェント用の移行ツールを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト