OSU-NLP-Group/UGround

[ICLR'25 Oral] UGround: Universal GUI Visual Grounding for GUI Agents

🎯 UGround とは何ですか?

UGround は、グラフィカルユーザーインターフェース(GUI)エージェント向けの 視覚的接地 を扱うオープンソースの研究プロジェクトです。スクリーンショットと自然言語の記述(例:「送信ボタンをクリック」)が与えられたとき、モデルは参照されたUI要素の (x, y) 座標を予測します。コード、事前学習済み重み、学習データ、評価スイートはすべて公開されており、ICLR 2025で口頭発表論文として採択されました。


📚 主な貢献

コンポーネント 提供内容
モデルファミリー GUI接地に最適化された Qwen2-VL ベースの視覚言語モデル(2 B、7 B、72 B)の3サイズ(UGround-V1 と命名)。
学習データ 100万枚以上のGUIスクリーンショットとバウンディングボックスアノテーション(UGround-V1 データセット)を Hugging Face でホスト。別途「ボックスのみ」バージョンも利用可能。
評価スイート ScreenSpot、Multimodal-Mind2Web、OmniAct、AndroidControl の4つの既存GUI接地ベンチマーク用の実行可能スクリプト、およびライブエージェントベンチマーク(Mind2Web-Live-SeeAct-V、AndroidWorld-SeeAct-V)
デモ 画像と記述をアップロードできる Hugging Face Spaces ウェブデモ。予測座標を返します。
論文と結果 ICLR 2025 全論文、arXiv 上のプレプリント、および最先端のパフォーマンスを示すリーダーボード(例:72Bモデルで ScreenSpot で平均89.4%)

🚀 インフェレンスの開始方法

1. 必要なPythonパッケージをインストール

pip install "git+https://github.com/huggingface/transformers@21fac7abba2a37fae86106f87fcf9974fd1e3830"
pip install accelerate qwen-vl-utils "vllm==0.6.1"

2. vLLM を使ってモデルを実行(高スループットサーバー)

# 7-Bチェックポイントの例
vllm serve osunlp/UGround-V1-7B \
    --api-key <your-token> \
    --dtype float16

リポジトリはより安定したデコードのために float16 を推奨しています。

3. 接地プロンプトを構築

def format_openai_template(description, base64_image):
    return [{
        "role": "user",
        "content": [
            {"type": "image_url",
             "image_url": {"url": f"data:image/jpeg;base64,{base64_image}"}},
            {"type": "text",
             "text": f"""あなたのタスクは、記述に基づいて画面内の特定の領域/要素/オブジェクトの正確な座標 (x, y) を特定することです。

- 記述された要素の中心を指す単一の文字列 "x, y" を返してください。
- 記述が曖昧な場合、最も妥当な要素を選んでください。
- モデルは [0, 1000) の範囲で座標を出力します。ピクセル値を得るには (幅/1000, 高さ/1000) でスケーリングしてください。

記述: {description}

回答:"""
        ]
    }]

temperature=0messages リストを vLLM の OpenAI互換エンドポイントに送信すると、決定論的な座標が得られます。


📂 リポジトリ構成(概要)

  • train/ – UGroundデータ上で Qwen2-VL をファインチューニングするためのスクリプト。
  • offline_evaluation/ – ScreenSpot、Multimodal-Mind2Web、OmniACT、AndroidControl の4つの静的ベンチマーク用のコードと結果。
  • online_experiments/ – モデルをインタラクティブな環境で実行する外部リポジトリへのリンク(Mind2Web-Live-SeeAct-V、AndroidWorld-SeeAct-V)。
  • README.md – 本概要、重み、データ、デモ、引用へのリンク。

📊 パフォーマンスハイライト(ScreenSpotベンチマーク)

モデル サイズ 平均スコア
UGround-V1-2B (Qwen2-VL) 2 B 77.7
UGround-V1-7B (Qwen2-VL) 7 B 86.3
UGround-V1-72B (Qwen2-VL) 72 B 89.4
Claude (Computer-Use) 82.9

72Bチェックポイントは、標準 ScreenSpot設定ですべての先行モデルを上回り、GPT-4oをプランナーとして使用したエージェント設定でも最高スコアを達成しています。


🌐 リソースとリンク


📜 引用

@inproceedings{gou2024uground,
  title={Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents},
  author={Boyu Gou and Ruohan Wang and Boyuan Zheng and Yanan Xie and Cheng Chang and Yiheng Shu and Huan Sun and Yu Su},
  booktitle={International Conference on Learning Representations},
  year={2025},
  url={https://openreview.net/forum?id=kxnoqaisCT}
}

TL;DR: UGroundは、自然言語からUI要素を正確に特定できる、すぐに使える高パフォーマンスな視覚言語モデルを提供しており、データ、重み、ベンチマーク、ライブデモをすべて備えています。GUI対応エージェントを必要とする研究や製品開発の基盤として最適です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト