Hugging Face ScreenSuite 发布

Hugging Face 推出了 ScreenSuite,这是一套统一的评估框架,旨在对 GUI(图形用户界面)代理的性能进行基准测试。通过整合 13 项不同的基准,ScreenSuite 提供了一种标准化的方法来评估视觉语言模型(VLM)在桌面、移动和网页环境中如何感知、导航和执行任务。

GUI 代理能力的统一评估

ScreenSuite 将 GUI 代理的能力划分为四个主要类别,以提供对模型性能的细粒度理解。该套件整合了以下基准:

感知与定位

这些基准评估模型正确感知屏幕信息并理解元素精确位置以实现准确点击的能力。

  • ScreenQA-Short & ScreenQA-Complex:移动环境评估。
  • ScreenSpot-v2 & ScreenSpot-Pro:桌面环境评估。
  • WebSRC & VisualWebBench:网页环境评估。

单步操作

这些基准测试使用单一步骤正确解决指令的能力。

  • Showdown-clicks:网页环境。
  • AndroidControl:移动环境。
  • Multimodal-Mind2web:网页环境。

多步代理

这些基准通过一系列操作评估更高层次的目标实现。由于这些基准需要虚拟环境,ScreenSuite 提供对 E2B 桌面远程沙箱以及用于 Ubuntu 和 Android 虚拟机的自定义 Docker 容器的支持。

  • AndroidWorld (including MobileMiniWob):移动环境。
  • OSWorld:桌面环境。
  • BrowseComp:网页环境。
  • GAIA-Web:网页环境。
  • Mind2Web-Live:网页环境。

技术实现与仅视觉方法

ScreenSuite 为模块化和一致性而构建,使用 smolagents 框架进行代理执行和在线基准的编排。

ScreenSuite 的一个关键技术区别在于其 仅视觉 方法。与许多现有基准提供可访问性树或 DOM(文档对象模型)元数据给模型不同,ScreenSuite 完全依赖视觉输入。此设计旨在模拟人类与界面的交互,使评估更真实、更具挑战性。例如,在 Multimodal Mind2Web 基准中,ScreenSuite 用基于视觉的边界框点击精度取代了基于元素名称的多选选择。

VLM 性能排名

Hugging Face 使用 ScreenSuite 对多款领先的 VLM 进行评估,包括 Qwen-2.5-VL 系列(3B 到 72B)、UI-Tars-1.5-7B、Holo1-7B 和 GPT-4o。结果总体上与行业报告一致,但由于严格的仅视觉要求提升了任务难度,分数可能与其他来源有所差异。

部署与使用

ScreenSuite 可通过其 GitHub 仓库在本地部署。设置需要克隆带有子模块的仓库,并使用 uv 安装包。用户可以通过 run.pyexamples/run_benchmarks.py 执行评估,以实现模型的并行评估。请注意,多步基准需要裸金属机器来运行必要的桌面和移动环境模拟器。

Sources