microsoft/OmniParser

A simple screen parsing tool towards pure vision based GUI agent

해결하는 문제

OmniParser은 시각 기반 AI 에이전트가 그래픽 사용자 인터페이스(GUI)와 상호작용하는 데 어려움을 해결합니다. 일반적인 시각 모델인 GPT-4V가 스크린샷에서 특정 화면 요소를 정확히 식별하고 작업을 정확히 지정하는 것이 어려운 문제를 해결합니다.

작동 방식

OmniParser은 두 가지 주요 구성 요소를 결합하여 스크린샷을 구조화된 요소로 파싱합니다. 첫 번째는 YOLOv9-E와 같은 모델을 사용한 인터랙티브 영역 탐지기로 클릭 가능한 영역을 찾고, 두 번째는 해당 요소에 대한 설명 텍스트를 제공하는 아이콘 기능 설명 모델입니다. 이 과정을 통해 원시 이미지가 대규모 언어 모델(LLM)이 정확한 좌표와 작업을 생성할 수 있는 구조화된 맵으로 변환됩니다.

대상 사용자

접근성 트리나 메타데이터에 의존하지 않고 순수한 시각 정보만으로 소프트웨어 인터페이스(예: Windows 11)를 탐색해야 하는 GUI 에이전트 또는 '컴퓨터 사용' 에이전트를 개발하는 개발자들을 위한 것입니다.

주요 특징

  • 구조화된 파싱: 원시 스크린샷을 이해하기 쉬운 요소로 변환하여 더 정확한 위치 기반을 가능하게 합니다.
  • OmniTool 통합: OpenAI(4o/o1/o3-mini), DeepSeek(R1), Qwen(2.5VL), Anthropic Computer Use 등의 모델을 사용해 Windows 11 VM을 제어하는 도구를 포함합니다.
  • 인터랙티비티 예측: 버전 1.5에서는 검출된 화면 요소가 실제로 상호작용 가능한지 예측할 수 있는 기능이 추가되었습니다.
  • 최첨단 성능: Screen Spot Pro 및 Windows Agent Arena와 같은 위치 기반 벤치마크에서 높은 성능을 달성합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트