Hugging Face ScreenSuite リリース

Hugging Face は ScreenSuite を導入しました。これは GUI(グラフィカルユーザーインターフェース)エージェントの性能をベンチマークするために設計された統合評価フレームワークです。13 の異なるベンチマークを統合することで、ScreenSuite はデスクトップ、モバイル、ウェブ環境における Vision Language Models(VLM)の認識、ナビゲーション、タスク実行を標準化された方法で評価します。

GUI エージェント能力の統一評価

ScreenSuite は GUI エージェントの能力を 4 つの主要カテゴリに整理し、モデル性能の詳細な理解を提供します。スイートには以下のベンチマークが統合されています。

認識とグラウンディング

これらのベンチマークは、画面上の情報を正しく認識し、要素の正確な位置を把握してクリックできるかを評価します。

  • ScreenQA-Short & ScreenQA-Complex: モバイル環境の評価。
  • ScreenSpot-v2 & ScreenSpot-Pro: デスクトップ環境の評価。
  • WebSRC & VisualWebBench: ウェブ環境の評価。

単一ステップアクション

これらのベンチマークは、単一のアクションで指示を正しく解決できるかをテストします。

  • Showdown-clicks: ウェブ環境。
  • AndroidControl: モバイル環境。
  • Multimodal-Mind2web: ウェブ環境。

マルチステップエージェント

これらのベンチマークは、一連のアクションを通じて上位レベルの目標達成を評価します。仮想環境が必要なため、ScreenSuite は E2B デスクトップリモートサンドボックスと Ubuntu および Android 仮想マシン用のカスタム Docker コンテナをサポートします。

  • AndroidWorld (including MobileMiniWob): モバイル環境。
  • OSWorld: デスクトップ環境。
  • BrowseComp: ウェブ環境。
  • GAIA-Web: ウェブ環境。
  • Mind2Web-Live: ウェブ環境。

技術実装と Vision-Only アプローチ

ScreenSuite はモジュラリティと一貫性を重視して構築されており、オンラインベンチマークでのエージェント実行とオーケストレーションに smolagents フレームワークを利用しています。

ScreenSuite の重要な技術的特徴は vision-only アプローチです。多くの既存ベンチマークがアクセシビリティツリーや DOM(Document Object Model)メタデータをモデルに提供するのに対し、ScreenSuite は視覚入力のみを使用します。この設計は、人間がインターフェースとやり取りする方法を模倣し、評価をより現実的かつ挑戦的にすることを目的としています。例えば、Multimodal Mind2Web ベンチマークでは、ScreenSuite は要素名に基づく選択肢方式を廃止し、視覚情報だけでバウンディングボックス内のクリック精度で評価します。

VLM パフォーマンスランキング

Hugging Face は ScreenSuite を用いて、Qwen-2.5-VL シリーズ(3B から 72B)、UI-Tars-1.5-7B、Holo1-7B、GPT-4o などの主要 VLM を評価しました。結果は概ね業界レポートと一致していますが、厳格な vision-only 要件によりタスク難易度が上がるため、他のソースとはスコアが異なる場合があります。

デプロイと使用方法

ScreenSuite は GitHub リポジトリからローカルにデプロイできます。セットアップはサブモジュール付きでリポジトリをクローンし、uv を使ってパッケージをインストールする必要があります。ユーザーは run.py または examples/run_benchmarks.py を実行して、並列モデル評価を行えます。マルチステップベンチマークは、必要なデスクトップおよびモバイル環境エミュレータを実行できるベアメタルマシンが必要です。

Sources