Holo1 と Surfer-H: GUI 自動化のためのオープンソース Action VLM
H Company は、深層ウェブ UI の理解と正確な要素ローカリゼーションを目的に設計された Action VLM のファミリーである Holo1 と、実世界タスクで 92.2% の精度を、タスクあたり $0.13 のコストで達成するモジュラー Web エージェント Surfer-H をリリースしました。このリリースは、正確な UI ローカリゼーションとモジュラーエージェントアーキテクチャを組み合わせることで、高性能なウェブ自動化へのコスト効率の高い道筋を提供します。
Holo1 Action VLM
Holo1 は、深層ウェブ UI の理解と正確な要素ローカリゼーションを目的に設計された Action VLM のファミリーです。モデルは Qwen2.5-VL アーキテクチャをベースにしており、Hugging Face の transformers ライブラリと完全に互換性があります。
モデルのバリエーションと性能
このファミリーは主に 2 つのサイズで構成されています:
- Holo1-3B: Action VLM の小型で効率的なバージョンです。
- Holo1-7B: 大型バリエーションで、一般的な UI ローカリゼーションベンチマークで平均 76.2% の精度を達成し、小型モデルの中で最高の性能を記録しています。
WebClick ベンチマーク
モデルと共に、H Company は WebClick をリリースしました。これは Hugging Face Hub にホストされた新しいマルチモーダルローカリゼーションベンチマークです。WebClick には、グラフィカルユーザーインターフェース内の要素を正確にローカライズするモデルの能力を評価するために設計された、1,639 のヒューマンライクな UI タスクが含まれています。
Surfer-H Web エージェント
Surfer-H は、Holo1 ファミリーのオープンウェイトモデルを活用して完全なウェブタスクを自動化するモジュラーなウェブネイティブエージェントです。脆弱なラッパーやカスタム API に依存するエージェントとは異なり、Surfer-H はブラウザと人間のユーザーと同様に対話し、読み取り、思考、クリック、スクロール、入力、検証といった操作を行います。
モジュラーアーキテクチャ
Surfer-H は 3 つの独立したコンポーネントで構成されています:
- Policy Model: エージェント全体の行動計画と駆動を担当します。
- Localizer Model: Holo1 を利用して視覚的 UI を理解し、正確なインタラクションを実現します。
- Validator Model: 割り当てられたタスクが正常に完了したかどうかを確認します。
効率とベンチマーク
Surfer-H は WebVoyager ベンチマークにおいて、コスト効率の高いウェブナビゲーションの新たなパレートフロンティアを確立しました。実世界のウェブタスクで 92.2% の精度を達成し、タスクあたりわずか $0.13 の運用コストで実行できます。
技術的実装
Holo1 モデルは、transformers ライブラリの AutoModelForImageTextToText と AutoProcessor クラスを使用して統合できます。モデルは画像とテキスト指示(例: "Select July 14th as the check-out date")を受け取り、Click(x, y) 形式で特定のクリック位置を出力します。ここで x と y はそれぞれ画像の左端と上端からのピクセル数を表します。