Hugging Face ScreenSuite 릴리스

Hugging Face는 GUI(그래픽 사용자 인터페이스) 에이전트의 성능을 벤치마크하기 위해 설계된 통합 평가 프레임워크인 ScreenSuite를 소개했습니다. 13개의 서로 다른 벤치마크를 통합함으로써, ScreenSuite는 Vision Language Models (VLMs)이 데스크톱, 모바일 및 웹 환경에서 어떻게 인식하고, 탐색하며, 작업을 수행하는지를 평가하는 표준화된 방법을 제공합니다.

GUI 에이전트 능력의 통합 평가

ScreenSuite는 GUI 에이전트 능력을 네 가지 주요 카테고리로 정리하여 모델 성능에 대한 세밀한 이해를 제공합니다. 이 스위트는 다음 벤치마크를 통합합니다:

인식 및 그라운딩

이 벤치마크들은 모델이 화면상의 정보를 정확히 인식하고, 정확한 클릭을 위해 요소들의 정확한 위치를 이해하는 능력을 평가합니다.

  • ScreenQA-Short & ScreenQA-Complex: 모바일 환경 평가.
  • ScreenSpot-v2 & ScreenSpot-Pro: 데스크톱 환경 평가.
  • WebSRC & VisualWebBench: 웹 환경 평가.

단일 단계 행동

이 벤치마크들은 단일 행동을 사용하여 지시를 정확히 해결하는 능력을 테스트합니다.

  • Showdown-clicks: 웹 환경.
  • AndroidControl: 모바일 환경.
  • Multimodal-Mind2web: 웹 환경.

다단계 에이전트

이 벤치마크들은 일련의 행동을 통해 고수준 목표 달성을 평가합니다. 이러한 벤치마크는 가상 환경이 필요하기 때문에, ScreenSuite는 E2B 데스크톱 원격 샌드박스와 Ubuntu 및 Android 가상 머신용 맞춤형 Docker 컨테이너를 지원합니다.

  • AndroidWorld (including MobileMiniWob): 모바일 환경.
  • OSWorld: 데스크톱 환경.
  • BrowseComp: 웹 환경.
  • GAIA-Web: 웹 환경.
  • Mind2Web-Live: 웹 환경.

기술 구현 및 비전 전용 접근 방식

ScreenSuite는 모듈성 및 일관성을 위해 설계되었으며, 온라인 벤치마크에서 에이전트 실행 및 오케스트레이션을 위해 smolagents 프레임워크를 활용합니다.

ScreenSuite의 핵심 기술적 차별점은 vision-only 접근 방식입니다. 많은 기존 벤치마크가 모델에 접근성 트리나 DOM(문서 객체 모델) 메타데이터를 제공하는 것과 달리, ScreenSuite는 시각 입력만을 사용합니다. 이러한 설계 선택은 인간이 인터페이스와 상호작용하는 방식을 반영하여 평가를 보다 현실적이고 도전적으로 만들기 위함입니다. 예를 들어, Multimodal Mind2Web 벤치마크에서 ScreenSuite는 요소 이름 기반의 다중 선택을 시각만을 기반으로 한 경계 상자 내 클릭 정밀도로 대체합니다.

VLM 성능 순위

Hugging Face는 Qwen-2.5-VL 시리즈(3B~72B), UI-Tars-1.5-7B, Holo1-7B, GPT-4o 등을 포함한 여러 주요 VLM을 ScreenSuite를 사용해 평가했습니다. 결과는 일반적으로 업계 보고서와 일치하지만, 엄격한 vision-only 요구사항으로 인해 작업 난이도가 높아져 점수가 다른 출처와 다를 수 있습니다.

배포 및 사용법

ScreenSuite는 GitHub 저장소를 통해 로컬에 배포할 수 있습니다. 설정은 서브모듈을 포함해 저장소를 클론하고 uv를 사용해 패키지를 설치해야 합니다. 사용자는 run.py 또는 examples/run_benchmarks.py를 통해 병렬 모델 평가를 실행할 수 있습니다. 다단계 벤치마크는 필요한 데스크톱 및 모바일 환경 에뮬레이터를 실행하기 위해 베어 메탈 머신이 필요합니다.

Sources