Holotron-12B 高スループットコンピュータ使用エージェント

ハイブリッドSSMアーキテクチャによる高スループット

Holotron-12Bは、ハイブリッドState-Space Model(SSM)とアテンション機構を利用することで高い推論効率を実現します。このアーキテクチャは高スループットサービス向けに特化して最適化されており、純粋なトランスフォーマーベースのモデルに比べていくつかの利点があります:

  • Reduced Memory Footprint: Vanilla attentionとは異なり、トークンとレイヤーごとにKVアクティベーション(KV Cache)を保存する必要がありますが、SSMは線形再帰モデルで、生成シーケンスごとにレイヤーあたり一定の状態のみを保存します。シーケンス長に依存しません。
  • Linear Scalability: 設計はフルアテンションに伴う二次的計算コストを回避し、複数の高解像度画像や長いインタラクション履歴を含む長文脈推論に対してより効率的です。
  • Increased Throughput: WebVoyager Benchmarkを単一のH100 GPU上でvLLM(v0.14.1)を使用してテストした結果、Holotron-12BはHolo2-8Bに比べて2倍以上のスループットを達成しました。

制御された実験において、Holotron-12Bの総トークンスループットは最大同時実行数100で安定的に8.9kトークン/秒まで上昇したのに対し、Holo2-8Bは5.1kトークン/秒で頭打ちになりました。これはVRAMの利用効率が向上し、メモリフットプリントが小さくなることで、同一ハードウェア上でより大きな実効バッチサイズが可能になることを示しています。

トレーニング手法とデータ

Holotron-12Bは2段階で開発され、NVIDIA Nemotron-Nano-12B-v2-VL-BF16マルチモーダルベースモデルから開始されました。モデルはH Companyの独自のローカリゼーションおよびナビゲーションデータミックスで教師ありファインチューニングされ、以下の3つの主要領域に焦点を当てました:

  1. 画面理解
  2. グラウンディング
  3. UIレベルのインタラクション

最終チェックポイントは約140億トークンでトレーニングされました。

パフォーマンスベンチマーク

Holotron-12BはベースのNemotronモデルに対して大幅な改善を示し、主要なベンチマークにおいて既存のエージェントモデルと競争力のある性能を示します:

エージェント性能

WebVoyagerベンチマークにおいて、Holotron-12Bの性能は35.1%(ベースNemotron)から80.5%に向上し、Holo2-8Bの性能を上回りました。

ローカリゼーションとグラウンディング

モデルはローカリゼーションとグラウンディングのベンチマークでもベースNemotronモデルに対して大幅な改善を示しました。具体的には:

  • OS-World-G
  • GroundUI
  • WebClick

今後の展望: Nemotron 3 Omni

Holotron-12Bの成果を踏まえて、H CompanyはNemotron 3 Omniアーキテクチャを用いた次世代マルチモーダルモデルのポストトレーニングを準備しています。この次のイテレーションでは、強化されたハイブリッドSSM-AttentionとMixture-of-Experts(MoE)を基盤として、推論能力、マルチモーダル精度を向上させ、 大規模な自律コンピュータ使用展開に必要な低レイテンシ性能を提供します。

Sources