microsoft/OmniParser

A simple screen parsing tool towards pure vision based GUI agent

何を解決するか

OmniParserは、視覚ベースのAIエージェントがグラフィカルユーザーインターフェース(GUI)と相互作用する際の困難を解決します。スクリーンショットから特定の画面要素を正確に識別し、その位置を特定する問題を解決します。これは、GPT-4Vのような汎用視覚モデルにとってしばしば課題となる問題です。

動作方法

OmniParserは、2つの主要なコンポーネントを組み合わせることでスクリーンショットを構造化された要素に変換します。1つは、YOLOv9-Eなどのモデルを使用したインタラクティブ領域検出器で、クリック可能な領域を検出します。もう1つは、その要素にキャプションを提供するアイコン機能記述モデルです。このプロセスにより、生の画像が大規模言語モデル(LLM)が正確な座標と操作を生成できる構造化マップに変換されます。

対象ユーザー

GUIエージェントや「コンピュータ操作」エージェントを構築する開発者向けです。これらは、アクセシビリティツリーまたはメタデータに依存せずに、純粋な視覚情報のみを使ってソフトウェアインターフェース(例:Windows 11)をナビゲートする必要があります。

主な特徴

  • 構造化パース: 生のスクリーンショットを理解しやすい要素に変換し、より正確な位置特定を可能にします。
  • OmniTool統合: OpenAI(4o/o1/o3-mini)、DeepSeek(R1)、Qwen(2.5VL)、Anthropic Computer Useなどのモデルを使用してWindows 11 VMを制御するツールを含みます。
  • インタラクタビリティ予測: バージョン1.5では、検出された画面要素が実際に操作可能かどうかを予測できる機能が追加されました。
  • 最先端のパフォーマンス: Screen Spot ProやWindows Agent Arenaなどの位置特定ベンチマークで高い成果を達成しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト