NVIDIA DGX Spark と Reachy Mini 統合ガイド

CES 2026において、NVIDIAは DGX Spark の処理能力と Reachy Mini ロボットを組み合わせることで、AIエージェントを物理世界へと送り出すシステムを発表しました。この統合により、開発者はオープンな推論モデルとビジョンモデルを搭載し、リアルタイムの音声および視覚的なインタラクションが可能な、プライベートでカスタマイズ可能なオフィスアシスタントを構築できます。

コア技術コンポーネント

このシステムは、オープンなモデルとフレームワークのモジュール式スタックに基づいて構築されており、開発者はコアロジックを書き換えることなくコンポーネントを入れ替えることができます。主な「構成要素」は以下の通りです:

  • 推論モデル: NVIDIA Nemotron 3 Nano (30B A3B BF16)。
  • ビジョンモデル: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16)。
  • Text-to-Speech: ElevenLabs。
  • ハードウェア/シミュレーション: Reachy Mini (物理ハードウェアまたはシミュレーション)。
  • オーケストレーション: NVIDIA NeMo Agent Toolkit。
  • リアルタイム・マルチモーダル処理: 低遅延のオーディオ/ビデオストリームのための Pipecat フレームワーク。

エージェント・アーキテクチャとオーケストレーション

NeMo Agent Toolkit は中央ハブとして機能し、モデルとハードウェアを接続します。これはフレームワークに依存しない設計になっており、LangChain、LangGraph、CrewAI などの他のエージェント・フレームワークとの互換性があります。

インテントベースのルーティング

レイテンシとコストを最適化するために、システムはすべてのタスクに単一のモデルを使用するのではなく、ルーター(microsoft/phi-3-mini-128k-instruct モデルなど)を使用して、意図(intent)に基づいてクエリを振り分けます:

  • テキストクエリ: 単純な雑談やカジュアルな会話のために、高速なテキストモデルにルーティングされます。
  • 視覚クエリ: ユーザーが周囲の環境、外見、または視界内の物体について尋ねた場合、Vision Language Model (VLM) にルーティングされます。
  • アクション/ツールリクエスト: 外部情報や物理的なロボットの動作を必要とするタスクのために、ReAct エージェントにルーティングされます。

ReAct によるツール呼び出し

システムは、NeMo Agent Toolkit 内の組み込み ReAct エージェント を利用してツール呼び出しを処理します。これにより、エージェントは最終的な回答を出す前に、Wikipedia 検索の実行や特定のロボット動作のトリガーなど、複数のツール呼び出しの間で推論を行うことができます。安全性と安定性を確保するために、実装では厳密なツールスキーマと、ツール呼び出しの最大回数 (max_tool_calls) の制限が推奨されています。

リアルタイム・インタラクションとハードウェア統合

リアルタイム機能は Pipecat によって管理され、ロボットのカメラ(視覚用)、音声認識(入力用)、および Text-to-Speech(出力用)をオーケストレーションします。

Reachy Mini ロボットは物理的なエンドポイントとして機能します。これはボットサービスが接続するためのデーモンを公開しており、同じ Python コードで物理ロボットまたはシミュレーションのいずれかを制御できます。このアーキテクチャにより、知覚、推論、および行動が物理的なフォームファクタにおいて密接に結合されることが保証されます。

デプロイメントオプション

開発者は、主に以下の3つの方法でこのエージェントスタックをデプロイできます:

  1. ローカルデプロイ: DGX Spark または十分な VRAM を持つ GPU 上で実行(推論モデルに約 65GB、ビジョンモデルに約 28GB のディスク容量が必要)。
  2. クラウドデプロイ: NVIDIA Brev または Hugging Face Inference Endpoints を介したクラウド GPU の利用。
  3. サーバーレスエンドポイント: NVIDIA または Hugging Face Inference Providers を介したリモートエンドポイントへの接続。

Sources