Holo1 与 Surfer-H:用于 GUI 自动化的开源 Action VLM

H 公司推出了 Holo1,这是一系列开源的 Action 视觉语言模型(VLM),以及 Surfer-H,这是一款面向网页的代理,旨在实现类人浏览器交互。此发布通过将精确的 UI 定位与模块化代理架构相结合,提供了一条高性价比的高性能网页自动化路径。

Holo1 Action VLM

Holo1 是一系列专为深度网页 UI 理解和精确元素定位而设计的 Action VLM。模型基于 Qwen2.5-VL 架构,并且完全兼容 Hugging Face transformers 库。

模型变体与性能

该系列包括两种主要规模:

  • Holo1-3B:Action VLM 的小型高效版本。
  • Holo1-7B:更大的变体,在常见 UI 定位基准上实现了 76.2% 的平均准确率,是小尺寸模型中记录的最高性能。

WebClick 基准

与此同时,H 公司发布了 WebClick,一个托管在 Hugging Face Hub 上的新多模态定位基准。WebClick 包含 1,639 个类人 UI 任务,旨在评估模型在图形用户界面中准确定位元素的能力。

Surfer-H 网页代理

Surfer-H 是一个模块化的网页原生代理,利用 Holo1 系列的开源权重模型来自动化完整的网页任务。不同于依赖脆弱包装器或自定义 API 的代理,Surfer-H 以纯粹的人类用户方式与浏览器交互,执行阅读、思考、点击、滚动、输入和验证等操作。

模块化架构

Surfer-H 由三个独立组件组成:

  1. Policy Model:负责规划和驱动代理的整体行为。
  2. Localizer Model:利用 Holo1 理解视觉 UI,以实现精确交互。
  3. Validator Model:确认分配的任务是否已成功完成。

效率与基准

Surfer-H 在 WebVoyager 基准上为成本高效的网页导航建立了新的帕累托前沿。它在真实网页任务中实现了 92.2% 的准确率,运营成本仅为每任务 $0.13。

技术实现

Holo1 模型可以使用 transformers 库中的 AutoModelForImageTextToTextAutoProcessor 类进行集成。模型接受图像和文本指令(例如,“选择 7 月 14 日作为退房日期”),并以 Click(x, y) 的格式输出具体的点击位置,其中 x 和 y 分别表示相对于图像左边缘和上边缘的像素坐标。

Sources