xlang-ai/OSWorld-V2
OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
何を解決するか
OSWorld-V2 は、AIエージェントが「コンピュータの使用」を実行できるかどうかを評価するための標準化されたベンチマークと環境を提供します。長期間にわたる現実世界のタスクを、ブラウザ、アプリケーション、ファイルシステムを含む完全なオペレーティングシステムとやり取りする必要があるため、テストが困難である問題に対処しています。また、タスク定義とアセットを制限することで、ベンチマークの漏洩を防ぎます。
動作方法
このプロジェクトは、DockerまたはAWSを介して制御された仮想マシン(VM)環境を作成し、エージェントがアクションを実行できるようにします。目的を定義し、成功を評価するために、Hugging Faceにホストされたゲート付きPythonタスククラスとアセットを使用します。現実性と安定性を確保するために、モックされたウェブサイトと特定のタスク用に自己ホストされたGitLabインスタンスを採用しています。システムは複数環境での並列実行をサポートし、手動でのタスク検査やトラジェクトリ記録のためのツールも提供します。
対象ユーザー
マルチモーダルエージェントを構築しているAI研究者や開発者向けです。これらのエージェントはスクリーンの内容(スクリーンショットを介して)を認識し、コンピュータインターフェースとやり取りして、複雑なマルチステップワークフローを完了できる必要があります。
特徴
- 現実世界のシミュレーション:単純化されたAPIではなく、実際のOS環境でエージェントをテストします。
- 漏洩防止:タスククラスとアセットは、Hugging Faceのゲート付きデータセットを通じて配布され、エージェントが訓練データ内で答えを見つけることを防ぎます。
- 柔軟なインフラ:ローカルのDockerデプロイメントとスケーラブルなAWSベースの並列評価の両方をサポートします。
- 包括的なツールキット:トラジェクトリビューア、手動検査スクリプト、OSWorld 1.0から移行するエージェント用の移行ツールを含みます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト