Holo4 27Bおよび35B-A3Bエージェントモデルがリリースされました

TL;DR

Hugging FaceはHolo4シリーズをリリースしました。これは27Bの密なモデルと35B-A3BのMixture-of-Expertsモデルで、グラフィカルユーザーインターフェース、コード実行、MCP、APIを横断して動作可能です。競合するフロンティアモデルよりもはるかに低コストでありながら、学術ベンチマークで競争力のあるスコアを実現しています。


すべてのインターフェースにわたる統合されたエージェント機能

Holo4は、必要に応じてクリック、タイピング、コードの記述、コードの実行、MCPやAPIツールの呼び出しを行うように設計されています。単一の対話モードに特化したほとんどのエージェントモデルとは異なり、Holo4は各サブタスクに最適なインターフェースを使用します。これにより、GUI操作、ツール呼び出し、コード実行を組み合わせた現実のビジネスワークフローを処理できます。同じモデルを、モデルを切り替えることなく、デスクトップ、Webブラウザ、Androidデバイス、コードサンドボックス、およびビジネスAPIに対してデプロイ可能です。


低コストで競争力のあるベンチマーク性能

Holo4はQwenをベースにしており、大幅な改善が見られます。OSWorld 2.0ベンチマークでは、27Bバージョンが61.7%(クローズドソースのOpus 5.5は81.8%)、35B-A3Bバージョンが30.9%を記録しました。絶対的なスコアは低いものの、Holo4は桁違いに少ないパラメータ数で、かつタスクあたりのコストを大幅に抑えてこれらの結果を達成しています。OSWorld 2.0およびAutomationBenchのコストパフォーマンスチャートは、H Models APIにおけるHolo4のトークンベースの価格設定が、Qwen 3.8 27B、Qwen 3.6 35B-A3B、および主要なクローズドモデルよりも安価であることを示しています。


現実の専門的なソフトウェアタスク

Holo4は、内部のAgentic Task Factoryによって生成された約10,000のタスクでトレーニングされており、Webアプリ、MCPサーバー、デスクトップ環境をカバーしています。ベースモデルであるQwen 3.8 27Bとの直接比較において、Holo4は以下のような複雑なタスクを完了するために、一貫してより少ない呼び出し回数とより少ないトークン数で済みました。

  • FreeCADでのエッフェル塔の3Dモデリング – 84回 / 1.3Mトークン (Holo4) vs. 60回 / 1.0Mトークン (Qwen)。
  • FreeCADでのH-companyロゴの作成 – 94回 / 1.5Mトークン (Holo4) vs. 118回 / 1.9Mトークン (Qwen)。
  • Godotでのパックマン風ゲームの構築 – 68回 / 2.4Mトークン (Holo4) vs. 197回 / 11.4Mトークン (Qwen)。

これらの例は、GUI操作、コード生成、実行を単一の一貫したワークフローで調整するHolo4の能力を示しています。


トレーニングパイプラインとハーネスの改善

Agentic Task Factoryがトレーニングデータを生成し、ドキュメントやスクリーンショットをインタラクティブな環境と検証可能なタスクに変換しました。Holo4は127Bトークンでの教師ありファインチューニングを経て、2つの専門家RLポリシーからの強化学習を行い、その後単一のモデルにマージされました。モデルのトレーニングと並行して、チームは数百ステップにわたってコンテキストを管理する実行ループであるハーネスを再構築しました。主なハーネスのアップグレードは以下の通りです。

  • 数百ステップを追跡できる信頼性の高いメモリシステム。
  • デスクトップマシンへの直接シェルアクセス。
  • OSWorld 2.0の実行からの継続的なフィードバック。エージェントが失敗にタグを付け、エンジニアが修正を確認しました。

Holotron4 Nano: レシピをNemotron 3 Nano Omniに拡張

同じポストトレーニングスタックをNVIDIA Nemotron 3 Nano Omniモデルに適用した結果、30B-A3BエージェントモデルであるHolotron4 Nanoが生成されました。5つのタスクにわたるベンチマークでは、ベースのNemotronモデルに対して絶対パーセンテージポイントの向上が見られ、このレシピがモデルのサイズやアーキテクチャを超えて一般化できることが確認されました。


利用可能性と今後のステップ

Holo4の2つのバリエーションは、H Models APIで公開されています。モデルの重みは、BF16、FP8、NVFP4、および4ビットGGUF形式でHugging Faceでホストされており、より小型のHolotron4 Nanoも含まれています。チームは、推論をさらに高速化するために最適化されたDSparkドラフターチェックポイントを近日中にリリースする予定です。


リソース

Sources