NVIDIA Nemotron 3.5 Lightning および NeMo Switchyard リリース

NVIDIA Nemotron 3.5 Lightning と NeMo Switchyard がエージェント型 AI ワークフローを最適化

NVIDIA は、特化型の効率的なモデルが特定のタスクを処理し、フロンティアモデルがオーケストレーションを管理する「モデルのシステム」の展開を可能にする Nemotron 3.5 Lightning と NeMo Switchyard をリリースしました。このアーキテクチャにより、複雑で長期的なエージェント型 AI ワークロードに必要なインテリジェンスを損なうことなく、運用コストとレイテンシを削減できます。

Nemotron 3.5 Lightning: 高効率な特化型実行

Nemotron 3.5 Lightning は、マルチエージェントシステム内での大量の特化型タスク向けに設計された、300億パラメータの Mixture-of-Experts (MoE) オープンモデルです。コードレビュー、ツール利用、セキュリティアラートの監視、ドメイン固有のクエリなどのタスクに最適化されています。

パフォーマンスとカスタマイズ性

Nemotron 3.5 Lightning は、同クラスの他のモデルと比較して、最大4倍速い出力速度と30%速いエージェントタスク完了を実現します。オープンモデルであるため、組織は NVIDIA NeMo を使用して独自のドメインデータで事後学習(post-train)を行い、特定の業界ワークフローに対する精度を高めることができます。

展開の柔軟性

このモデルは、インフラ投資を最大化し、データプライバシーを確保するために、さまざまなハードウェア環境で動作するように設計されています:

  • ローカル AI システム: NVIDIA RTX PC、DGX Spark、DGX Station、および Jetson。
  • エンタープライズ インフラストラクチャ: RTX PRO ワークステーション、データセンター、およびクラウド環境。

透明性とさらなる開発をサポートするために、NVIDIA は Nemotron-RL-Agentic-Terminal-Pivot データセットをリリースしました。これは、コーディングエージェント機能のためにモデルを事後学習させるために使用されました。

NeMo Switchyard: インテリジェントなモデルルーティング

NeMo Switchyard は、AI エージェント向けのスマートルーティングを実装するオープンソースライブラリです。ワークフローの特定のステップの要件に基づいて、オープン、プロプライエタリ、または NVIDIA 固有のモデルの中から、最も適切なモデルにプロンプトを自動的に転送します。

効率の向上とトークノミクス

すべてのタスクを単一のフロンティアモデルに頼るのではなく、最も効率的なモデルにリクエストをルーティングすることで、企業は「トークノミクス(tokenomics)」を大幅に改善できます。内部ベンチマークでは、NeMo Switchyard がフロンティアレベルの精度を維持しつつ、タスク完了コストを Opus 4.8 のみの使用コストの約3分の1に削減することが示されています。

エコシステム統合とパートナーの実績

複数のパートナーが AI スタックを最適化するために NeMo Switchyard を統合しています:

  • LangChain: フロンティアモデルへのコールをわずか 7% に制限することで、マルチターン Deep Agents タスクのコストを 74% 削減したと報告(精度への影響は 6%)。
  • Ramp: Ramp SWE-Bench において、コストを 58% 削減し、実行時間を 33% 短縮。
  • Cognition: FrontierCode Main でフロンティアに近いパフォーマンスを維持しつつ、単一のフロンティアモデルと比較して平均コストを 28% 削減。
  • Boomi: 100% のドメインルーティング精度を達成し、後半のターンのレイテンシを 21% 削減。
  • Kong: 現在、Kong AI Gateway を介してルーティングを提供。

テクニカル コミュニティの視点

NVIDIA は Nemotron 3.5 Lightning の効率性を強調していますが、Hacker News での技術的な議論では、特に複雑なコーディングタスクにおける Mixture-of-Experts (MoE) アーキテクチャに関して、パフォーマンスの認識に違いが見られます。

MoE vs. Dense モデル

一部の開発者は、Nemotron 3.5 Lightning や Qwen 3.6-35B のような MoE モデルは非常に高速であるものの、同規模の Dense モデルと比較すると、複雑で多段階のロジックに苦戦する場合があることを報告しています。

「Mixture-of-Experts (MoE) モデル (Qwen 3.6-35B および Nemotron 3.5 Lightning) は、この [共同ホワイトボードの構築] において、なんて言うか、ひどい結果になります。全く仕事を成し遂げることができませんでした... 一方で、~30B の Dense モデル (MoE ではないもの) はかなり優秀です。」

ハードウェアとアクセシビリティ

ユーザーは、プラットフォームを問わないモデルの柔軟性に注目しており、MLX を介した Apple Silicon での実行成功が報告されていますが、古いハードウェアではパフォーマンスが低下する可能性があるとの警告もあります。また、16GB VRAM の制限があるユーザーにより良く対応するために、さらに小さな MoE モデル(例:12B)を求めるコミュニティの継続的な需要もあります。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch