xlang-ai/OSWorld

[NeurIPS 2024] OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments

What it solves

OSWorld는 실제 컴퓨터 운영 체제 내에서 개방형 작업을 수행하는 멀티모달 AI 에이전트의 능력을 평가하기 위한 표준화된 벤치마크와 환경을 제공합니다. 에이전트가 다양한 소프트웨어 애플리케이션 및 시스템 설정과 상호 작용해야 하는 실제 데스크톱 환경에서 테스트하는 어려움을 해결합니다.

How it works

이 프로젝트는 Ubuntu와 Windows를 지원하는 가상 데스크톱 환경을 생성하여 AI 에이전트가 상호 작용할 수 있게 합니다. VMware, VirtualBox, Docker, AWS, Daytona 등 여러 호스팅 제공자를 지원하며, 로컬 및 클라우드 기반 병렬 평가가 가능합니다. 에이전트는 스크린샷과 같은 관찰값을 받고 마우스 클릭이나 키보드 입력과 같은 행동을 실행하여 작업을 완료합니다. 시스템은 Office, Daily, Professional 등 다양한 도메인에 걸친 벤치마크 작업 세트를 포함하고, 실행 궤적을 기록하고 성공률을 계산하는 도구를 제공합니다.

Who it’s for

실제 소프트웨어와 운영 체제를 탐색하는 모델의 성능을 엄격하게 측정해야 하는 멀티모달 에이전트 및 "컴퓨터 사용" AI를 구축하는 연구자와 개발자를 위해 설계되었습니다.

Highlights

  • Multi-Platform Support: Compatible with VMware, VirtualBox, Docker, AWS, and Daytona.
  • Parallel Evaluation: AWS integration allows for large-scale parallelization to significantly reduce evaluation time.
  • Real-World Tasks: Includes a diverse set of benchmark tasks spanning professional and daily computer use.
  • Comprehensive Tooling: Provides scripts for running baseline agents, manual task examination, and result visualization.