Hugging Face ScreenSuite 發布

Hugging Face ScreenSuite 發布

Hugging Face 已發布 ScreenSuite,一個綜合性的 GUI 代理評估套件,統合了 13 個基準,用於評估視覺語言模型(VLM)在感知、定位與行動能力方面的表現。

Hugging Face ScreenSuite 發布

Hugging Face 推出了 ScreenSuite,一個統一的評估框架,旨在對 GUI(圖形使用者介面)代理的效能進行基準測試。透過整合 13 個不同的基準,ScreenSuite 提供了一種標準化的方式來評估視覺語言模型(VLM)在桌面、行動與網路環境中如何感知、導航與執行任務。

GUI 代理能力的統一評估

ScreenSuite 將 GUI 代理的能力分為四個主要類別,以提供對模型效能的細緻了解。此套件整合了以下基準:

感知與定位

這些基準評估模型正確感知螢幕資訊以及理解元素精確位置以進行準確點擊的能力。

  • ScreenQA-Short & ScreenQA-Complex:行動環境評估。
  • ScreenSpot-v2 & ScreenSpot-Pro:桌面環境評估。
  • WebSRC & VisualWebBench:網路環境評估。

單步操作

這些基準測試使用單一操作正確解決指令的能力。

  • Showdown-clicks:網路環境。
  • AndroidControl:行動環境。
  • Multimodal-Mind2web:網路環境。

多步驟代理

這些基準透過一系列操作評估更高層次目標的達成。由於需要虛擬環境,ScreenSuite 提供對 E2B 桌面遠端沙盒以及 Ubuntu 與 Android 虛擬機的自訂 Docker 容器的支援。

  • AndroidWorld(包括 MobileMiniWob):行動環境。
  • OSWorld:桌面環境。
  • BrowseComp:網路環境。
  • GAIA-Web:網路環境。
  • Mind2Web-Live:網路環境。

技術實作與僅視覺方法

ScreenSuite 為了模組化與一致性而構建,使用 smolagents 框架來執行代理並在線上基準中進行協調。

ScreenSuite 的一個關鍵技術區別是其 僅視覺 方法。與許多現有基準提供模型可存取的可及性樹或 DOM(文件物件模型)元資料不同,ScreenSuite 完全依賴視覺輸入。此設計旨在模仿人類與介面的互動,使評估更貼近現實且更具挑戰性。例如,在 Multimodal Mind2Web 基準中,ScreenSuite 以僅依視覺的方式,將基於元素名稱的多選取代為在邊界框內的點擊精度。

VLM 效能排名

Hugging Face 使用 ScreenSuite 評估了多個領先的 VLM,包括 Qwen-2.5-VL 系列(3B 至 72B)、UI-Tars-1.5-7B、Holo1-7B 與 GPT-4o。結果大致與業界報告相符,但由於嚴格的僅視覺要求提升了任務難度,分數可能與其他來源有所差異。

部署與使用

ScreenSuite 可透過其 GitHub 倉庫在本機部署。設定需要使用子模組克隆倉庫,並使用 uv 安裝套件。使用者可透過 run.pyexamples/run_benchmarks.py 進行平行模型評估。請注意,多步驟基準需要裸機以執行必要的桌面與行動環境模擬器。

Sources