Holotron-12B 高吞吐量電腦使用代理
H 公司發布了 Holotron-12B,一款專為電腦使用代理設計的多模態模型。透過在專有資料混合上對 NVIDIA Nemotron-Nano-2 VL 模型進行後訓練,H 公司開發出一個能在互動環境中高效感知、決策與行動的代理,針對生產規模與效能進行最佳化。
透過混合 SSM 架構實現高吞吐量
Holotron-12B 透過結合混合狀態空間模型(State-Space Model,SSM)與注意力機制,實現高推理效率。此架構專為高吞吐量服務進行優化,較純粹的 transformer 為基礎模型提供多項優勢:
- 降低記憶體占用: 與需要為每個 token 與每層儲存 KV 激活(即 KV Cache)的傳統注意力不同,SSM 為線性遞迴模型,只在每層每條生成序列中儲存一個恆定狀態,與序列長度無關。
- 線性可擴展性: 此設計避免了全注意力的二次方計算成本,使其在涉及多張高解析度影像與大量互動歷史的長上下文推理中更為高效。
- 提升吞吐量: 在單一 H100 GPU 上使用 vLLM(v0.14.1)執行 WebVoyager Benchmark 測試時,Holotron-12B 的吞吐量超過 Holo2-8B 超過兩倍。
在受控實驗中,Holotron-12B 的總 token 吞吐量在最大併發度 100 時穩步提升至 8.9k token/秒,而 Holo2-8B 則在 5.1k token/秒左右趨於平緩。此結果顯示出更有效的 VRAM 使用率與較小的記憶體占用,允許在相同硬體上使用更大的有效批次大小。
訓練方法與資料
Holotron-12B 以兩個階段開發,起始於 NVIDIA Nemotron-Nano-12B-v2-VL-BF16 多模態基礎模型。模型在 H 公司的專有定位與導航資料混合上進行監督式微調,重點聚焦於三大領域:
- 螢幕理解
- 定位(Grounding)
- UI 級別互動
最終檢查點的訓練資料約為 140 億 token。
效能基準
Holotron-12B 在多項關鍵基準上相較於基礎 Nemotron 模型展現顯著提升,且在與已建立的代理模型的比較中具備競爭力的表現:
代理效能
在 WebVoyager 基準上,Holotron-12B 的表現從 35.1%(基礎 Nemotron)提升至 80.5%,超過 Holo2-8B 的效能。
定位與 Grounding
模型在定位與 grounding 基準上亦相較於基礎 Nemotron 模型展現顯著提升,包含:
- OS-World-G
- GroundUI
- WebClick
未來展望:Nemotron 3 Omni
基於 Holotron-12B 的成果,H 公司正準備使用 Nemotron 3 Omni 架構對下一代多模態模型進行後訓練。此下一代將利用強化的混合 SSM‑Attention 與專家混合(Mixture-of-Experts,MoE)基礎,提升推理能力、多模態精度,並提供大規模自主電腦使用部署所需的低延遲效能。