NVIDIA Nemotron 3 Ultra リリース

NVIDIA Nemotron 3 Ultraは、複雑で長期間実行されるエージェント型ワークフロー向けに設計されたオープンモデルであり、数百回のツール呼び出しを伴うタスクにおいて高い精度とコスト効率を提供します。現在、Ollamaのクラウドで利用可能になっており、開発者はこれをエージェントのオーケストレーション、コーディングエージェント、およびディープリサーチのパイプラインに統合できます。

モデルアーキテクチャと効率性

Nemotron 3 Ultraは、合計5500億のパラメータを持つMixture-of-Experts (MoE) アーキテクチャを利用していますが、トークンあたりのアクティブなパラメータは550億のみです。この設計により、モデルは最先端レベルの推論能力を維持しながら、トークンあたりの計算オーバーヘッドを削減できます。

パフォーマンスとメモリフットプリントをさらに最適化するために、モデルはNVIDIAの4ビット浮動小数点形式であるNVFP4向けに最適化されています。この量子化により、モデルをより少ないメモリに詰め込み、標準的な形式よりも高速に実行することが可能になります。

長文コンテキストとエージェント機能

Nemotron 3 Ultraは、数百のステップにわたるエージェントのオーケストレーションやエンタープライズワークフロー向けに特別にチューニングされています。主な機能は以下の通りです:

  • 1M Token Context Window: モデルは、一貫性を失うことなく、コードベース全体、広範なツール履歴、およびリサーチの軌跡をコンテキストウィンドウ内に保持できます。
  • Agentic Specialization: モデルは、コーディングエージェント、ディープリサーチ、および高精度な指示への追従と複数のツール呼び出しを必要とする複雑なワークフロー向けに最適化されています。

パフォーマンスとコストのベンチマーク

NVIDIAとOllamaによると、Nemotron 3 Ultraは、エージェントの生産性、コーディング、および指示への追従のベンチマークにおいて、オープンモデルの中で精度においてトップを走っています。

運用効率の面では、モデルは優れたスループットとコスト効率を示しています。他の主要なオープンモデルと比較してコストを最大30%削減でき、コスト効率の最前線に位置しています。

デプロイメントと統合

Nemotron 3 Ultraは、Ollamaのクラウド経由でデプロイできます。以下のようないくつかのエージェント型ツールとの統合をサポートしています:

  • Claude Code: ollama launch claude --model nemotron-3-ultra:cloud
  • Hermes Agent: ollama launch hermes --model nemotron-3-ultra:cloud
  • OpenClaw: ollama launch openclaw --model nemotron-3-ultra:cloud
  • General Chat: ollama run nemotron-3-ultra:cloud

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch