microsoft/OmniParser
A simple screen parsing tool towards pure vision based GUI agent
解決的問題
OmniParser 解決了視覺基礎 AI 代理在與圖形使用者介面(GUI)互動時所面臨的困難。它解決了從截圖中準確識別並定位特定螢幕元素的挑戰,這通常是通用視覺模型(如 GPT-4V)難以應對的問題。
工作原理
OmniParser 透過結合兩個主要元件,將截圖解析為結構化元素:使用 YOLOv9-E 等模型的互動區域偵測器,用於識別可點擊區域;以及圖示功能描述模型,為這些元素提供描述性文字。此過程將原始影像轉換為大型語言模型(LLM)可使用的結構化地圖,進而生成精確的座標與操作指令。
適用對象
專為開發 GUI 代理或「電腦使用」代理的開發者設計,這些代理需要僅依靠視覺資訊,而非底層可存取性樹或元資料,來導航軟體介面(如 Windows 11)。
核心亮點
- 結構化解析:將原始截圖轉換為易於理解的元素,提升定位準確性。
- OmniTool 結合:內建工具,支援使用 OpenAI(4o/o1/o3-mini)、DeepSeek(R1)、Qwen(2.5VL)或 Anthropic Computer Use 等模型控制 Windows 11 虛擬機。
- 可互動性預測:1.5 版本新增預測偵測到的螢幕元素是否真正可互動的能力。
- 業界領先效能:在 Screen Spot Pro 和 Windows Agent Arena 等定位基準測試中表現優異。
相關
- 專案
- 專案
- 專案
- 專案
- 專案