xlang-ai/OSWorld-V2
OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
해결하는 문제
OSWorld-V2는 AI 에이전트가 "컴퓨터 사용"을 수행할 수 있는지를 평가하기 위한 표준화된 벤치마크와 환경을 제공합니다. 브라우저, 애플리케이션, 파일 시스템을 포함한 완전한 운영 체제와 상호작용해야 하는 장기적인 현실 세계 작업을 테스트하는 어려움을 해결합니다. 또한 작업 정의와 자산을 제한함으로써 벤치마크 유출을 방지합니다.
작동 방식
이 프로젝트는 Docker 또는 AWS를 통해 제어된 가상 머신(VM) 환경을 생성하여 에이전트가 액션을 실행할 수 있도록 합니다. 목표를 정의하고 성공 여부를 평가하기 위해 Hugging Face에 호스팅된 게이트된 Python 작업 클래스와 자산을 사용합니다. 현실성과 안정성을 보장하기 위해 특정 작업용으로 모의 웹사이트와 자체 호스팅된 GitLab 인스턴스를 사용합니다. 시스템은 다중 환경 병렬 실행을 지원하며, 수동 작업 검토 및 트래잭터리 기록을 위한 도구도 제공합니다.
대상 사용자
스크린 콘텐츠(스크린샷을 통해)를 인식하고 컴퓨터 인터페이스와 상호작용하여 복잡한 다단계 워크플로우를 완료할 수 있는 멀티모달 에이전트를 개발하는 AI 연구자 및 개발자에게 적합합니다.
주요 특징
- 현실 세계 시뮬레이션: 단순화된 API가 아닌 실제 OS 환경에서 에이전트를 테스트합니다.
- 유출 방지: 작업 클래스와 자산은 게이트된 Hugging Face 데이터셋을 통해 배포되어 에이전트가 학습 데이터에서 답을 찾는 것을 방지합니다.
- 유연한 인프라: 로컬 Docker 배포와 확장 가능한 AWS 기반 병렬 평가를 모두 지원합니다.
- 포괄적인 도구 세트: 트래잭터리 뷰어, 수동 검토 스크립트, OSWorld 1.0에서 이전하는 에이전트를 위한 마이그레이션 도구를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트