Holotron-12B 高吞吐量计算机使用代理
H 公司发布了 Holotron-12B,这是一款专为计算机使用代理设计的多模态策略模型。通过在专有数据混合上对 NVIDIA Nemotron-Nano-2 VL 模型进行后训练,H 公司开发了一个能够在交互环境中感知、决策和高效行动的代理,针对生产规模和性能进行优化。
通过混合 SSM 架构实现高吞吐量
Holotron-12B 通过使用混合状态空间模型(SSM)和注意力机制实现了高推理效率。该架构专为高吞吐量服务进行优化,较纯粹的基于 Transformer 的模型提供了多项优势:
- 降低内存占用: 与需要为每个 token 和每层存储 KV 激活(KV 缓存)的普通注意力不同,SSM 是线性递归模型,仅在每层每个生成序列中存储一个常数状态,与序列长度无关。
- 线性可扩展性: 该设计避免了全注意力的二次计算成本,使其在涉及多张高分辨率图像和大量交互历史的长上下文推理中更高效。
- 提升吞吐量: 在单个 H100 GPU 上使用 WebVoyager Benchmark 并配合 vLLM (v0.14.1) 测试时,Holotron-12B 的吞吐量是 Holo2-8B 的两倍以上。
在受控实验中,Holotron-12B 的总 token 吞吐量在最大并发度 100 时稳步上升至 8.9k token/秒,而 Holo2-8B 则在 5.1k token/秒处趋于平稳。这表明其 VRAM 利用更高效且内存占用更小,能够在相同硬件上使用更大的有效批量大小。
训练方法与数据
Holotron-12B 通过两阶段开发,从 NVIDIA Nemotron-Nano-12B-v2-VL-BF16 多模态基础模型开始。模型在 H 公司的专有定位与导航数据混合上进行监督微调,重点关注三个主要领域:
- 屏幕理解
- 定位(Grounding)
- UI 级交互
最终检查点在约 140 亿 token 上进行训练。
性能基准
Holotron-12B 在多个关键基准上相较于基础 Nemotron 模型表现出显著提升,并在与已建立的代理模型的竞争中表现出竞争力:
代理性能
在 WebVoyager 基准上,Holotron-12B 的表现从 35.1%(基础 Nemotron)提升至 80.5%,超越了 Holo2-8B 的性能。
定位与落地
模型在定位与落地基准上也相较于基础 Nemotron 模型展示了显著提升,包括:
- OS-World-G
- GroundUI
- WebClick
未来展望:Nemotron 3 Omni
基于 Holotron-12B 的成果,H 公司正准备使用 Nemotron 3 Omni 架构对下一代多模态模型进行后训练。下一迭代将利用增强的混合 SSM-注意力和 Mixture-of-Experts (MoE) 基础,以提升推理能力、多模态精度,并提供大规模自主计算机使用部署所需的低延迟性能。
SUMMARY: H 公司发布了 Holotron-12B,这是一款基于 NVIDIA Nemotron-Nano-2 VL 的多模态计算机使用模型,采用混合 SSM-注意力架构,实现了针对代理工作负载的高推理吞吐量。
TITLE: Holotron-12B 高吞吐量计算机使用代理