Holo1 與 Surfer-H:開源行動 VLM 用於 GUI 自動化
Holo1 與 Surfer-H:開源行動 VLM 用於 GUI 自動化
H Company 已發布 Holo1,一個旨在精確 GUI 定位的 Action Vision Language Model 系列,以及 Surfer-H,一個在真實任務中達到 92.2% 準確率且每項任務成本僅 $0.13 的模組化網路代理。
Holo1 和 Surfer-H:開源行動 VLM 用於 GUI 自動化
H Company 已推出 Holo1,一個專為深度網頁 UI 理解與精確元素定位而設計的 Action VLM 系列。這些模型基於 Qwen2.5-VL 架構,且與 Hugging Face transformers 函式庫完全相容。
Holo1 行動 VLM
模型變體與效能
該系列包含兩種主要規模:
- Holo1-3B:較小且高效的 Action VLM 版本。
- Holo1-7B:較大的變體,在常見 UI 定位基準測試中達到 76.2% 的平均準確率,為小尺寸模型中最高的表現。
WebClick 基準
與模型同步,H Company 發布了 WebClick,一個在 Hugging Face Hub 上託管的新多模態定位基準。WebClick 包含 1,639 個類似人類的 UI 任務,旨在評估模型在圖形使用者介面中精確定位元素的能力。
Surfer-H 網路代理
Surfer-H 是一個模組化的原生網路代理,利用 Holo1 系列的開放權重模型來自動化完整的網路任務。與依賴脆弱包裝器或自訂 API 的代理不同,Surfer-H 以純粹如同人類使用者的方式與瀏覽器互動,執行閱讀、思考、點擊、捲動、輸入與驗證等操作。
模組化架構
Surfer-H 由三個獨立元件組成:
- Policy Model:負責規劃與驅動代理的整體行為。
- Localizer Model:利用 Holo1 了解視覺 UI,以實現精確互動。
- Validator Model:確認指派的任務是否已成功完成。
效率與基準測試
Surfer-H 在 WebVoyager 基準上為成本效益高的網路導航建立了新的 Pareto 前緣。它在真實世界的網路任務中達到 92.2% 的準確率,且每項任務的運營成本僅為 $0.13。
技術實作
Holo1 模型可透過 transformers 函式庫中的 AutoModelForImageTextToText 與 AutoProcessor 類別整合。模型接受圖像與文字指令(例如「選擇 7 月 14 日作為退房日期」),並以 Click(x, y) 格式輸出具體的點擊位置,其中 x 與 y 分別代表相對於圖像左邊緣與上邊緣的像素數。