xlang-ai/OSWorld
[NeurIPS 2024] OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
What it solves
OSWorld は、実際のコンピュータ OS 内でオープンエンドタスクを実行するマルチモーダル AI エージェントの能力を評価するための標準化されたベンチマークと環境を提供します。エージェントがさまざまなソフトウェアアプリケーションやシステム設定とやり取りしなければならない本物のデスクトップ環境でのテストの難しさに対処します。
How it works
本プロジェクトは、Ubuntu と Windows をサポートする仮想デスクトップ環境を作成し、AI エージェントがそれと対話できるようにします。VMware、VirtualBox、Docker、AWS、Daytona など複数のホスティングプロバイダーに対応しており、ローカルおよびクラウドベースの並列評価が可能です。エージェントは観測(スクリーンショットなど)を受け取り、マウスクリックやキーボード入力といったアクションを実行してタスクを完了します。システムは Office、Daily、Professional といった異なるドメインにまたがるベンチマークタスクのセットを含み、実行軌跡の記録や成功率の算出ツールを提供します。
Who it’s for
実際のソフトウェアや OS を操作できるかを厳密に測定したい、マルチモーダルエージェントや「コンピュータ利用」AI を構築する研究者や開発者向けに設計されています。
Highlights
- Multi-Platform Support: Compatible with VMware, VirtualBox, Docker, AWS, and Daytona.
- Parallel Evaluation: AWS integration allows for large-scale parallelization to significantly reduce evaluation time.
- Real-World Tasks: Includes a diverse set of benchmark tasks spanning professional and daily computer use.
- Comprehensive Tooling: Provides scripts for running baseline agents, manual task examination, and result visualization.