Holo1 및 Surfer-H: GUI 자동화를 위한 오픈소스 Action VLMs

Holo1 Action VLMs

Holo1는 깊은 웹 UI 이해와 정밀한 요소 로컬라이제이션을 위해 특별히 설계된 Action VLMs 패밀리입니다. 이 모델들은 Qwen2.5-VL 아키텍처를 기반으로 하며 Hugging Face transformers 라이브러리와 완전히 호환됩니다.

모델 변형 및 성능

이 패밀리는 두 가지 주요 크기로 구성됩니다:

  • Holo1-3B: Action VLM의 더 작고 효율적인 버전입니다.
  • Holo1-7B: 더 큰 변형으로, 일반 UI 로컬라이제이션 벤치마크에서 평균 76.2% 정확도를 달성했으며, 소형 모델 중 가장 높은 성능을 기록했습니다.

WebClick 벤치마크

모델과 함께 H Company는 Hugging Face Hub에 호스팅된 새로운 멀티모달 로컬라이제이션 벤치마크 WebClick을 출시했습니다. WebClick은 그래픽 사용자 인터페이스 내에서 요소를 정확히 로컬라이즈하는 모델의 능력을 평가하기 위해 설계된 1,639개의 인간과 유사한 UI 작업을 포함합니다.

Surfer-H 웹 에이전트

Surfer-H는 Holo1 오픈-웨이트 모델 패밀리를 활용하여 전체 웹 작업을 자동화하는 모듈형 웹 네이티브 에이전트입니다. 깨지기 쉬운 래퍼나 맞춤 API에 의존하는 에이전트와 달리, Surfer-H는 브라우저와 인간 사용자가 하는 것처럼 순수하게 상호작용하며 읽기, 사고, 클릭, 스크롤, 입력, 검증과 같은 동작을 수행합니다.

모듈형 아키텍처

Surfer-H는 세 개의 독립적인 구성 요소로 이루어져 있습니다:

  1. Policy Model: 에이전트의 전체 행동을 계획하고 주도하는 역할을 담당합니다.
  2. Localizer Model: Holo1를 활용하여 시각적 UI를 이해하고 정밀한 상호작용을 수행합니다.
  3. Validator Model: 할당된 작업이 성공적으로 완료되었는지 확인합니다.

효율성 및 벤치마크

Surfer-H는 WebVoyager 벤치마크에서 비용 효율적인 웹 탐색을 위한 새로운 파레토 프론티어를 구축했습니다. 실제 웹 작업에서 92.2% 정확도를 달성했으며, 작업당 운영 비용은 단 $0.13에 불과합니다.

기술 구현

Holo1 모델은 transformers 라이브러리의 AutoModelForImageTextToTextAutoProcessor 클래스를 사용하여 통합할 수 있습니다. 모델은 이미지와 텍스트 지시문(예: "Select July 14th as the check-out date")을 입력으로 받아 Click(x, y) 형식의 특정 클릭 위치를 출력합니다. 여기서 x와 y는 각각 이미지의 왼쪽 및 위쪽 가장자리로부터의 픽셀 값을 나타냅니다.

Sources