microsoft/OmniParser

A simple screen parsing tool towards pure vision based GUI agent

解决的问题

OmniParser 解决了视觉基础 AI 代理在与图形用户界面(GUI)交互时面临的困难。它解决了从截图中准确识别并定位特定屏幕元素的难题,这通常是通用视觉模型(如 GPT-4V)难以应对的挑战。

工作原理

OmniParser 通过结合两个主要组件,将截图解析为结构化元素:使用 YOLOv9-E 等模型的交互区域检测器,用于识别可点击区域;以及图标功能描述模型,为这些元素提供描述性文字。这一过程将原始图像转化为大型语言模型(LLM)可使用的结构化地图,从而生成精确的坐标和操作指令。

适用人群

专为开发 GUI 代理或“计算机使用”代理的开发者设计,这些代理需要仅依靠视觉信息而非底层可访问性树或元数据来导航软件界面(如 Windows 11)。

核心亮点

  • 结构化解析:将原始截图转化为易于理解的元素,提升定位准确性。
  • OmniTool 集成:内置工具,支持使用 OpenAI(4o/o1/o3-mini)、DeepSeek(R1)、Qwen(2.5VL)或 Anthropic Computer Use 等模型控制 Windows 11 虚拟机。
  • 可交互性预测:1.5 版本新增了预测检测到的屏幕元素是否真正可交互的能力。
  • 业界领先性能:在 Screen Spot Pro 和 Windows Agent Arena 等定位基准测试中表现优异。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目