NVIDIA DGX Spark と Reachy Mini 統合ガイド
CES 2026において、NVIDIAは DGX Spark の処理能力と Reachy Mini ロボットを組み合わせることで、AIエージェントを物理世界へと送り出すシステムを発表しました。この統合により、開発者はオープンな推論モデルとビジョンモデルを搭載し、リアルタイムの音声および視覚的なインタラクションが可能な、プライベートでカスタマイズ可能なオフィスアシスタントを構築できます。
コア技術コンポーネント
このシステムは、オープンなモデルとフレームワークのモジュール式スタックに基づいて構築されており、開発者はコアロジックを書き換えることなくコンポーネントを入れ替えることができます。主な「構成要素」は以下の通りです:
- 推論モデル: NVIDIA Nemotron 3 Nano (30B A3B BF16)。
- ビジョンモデル: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16)。
- Text-to-Speech: ElevenLabs。
- ハードウェア/シミュレーション: Reachy Mini (物理ハードウェアまたはシミュレーション)。
- オーケストレーション: NVIDIA NeMo Agent Toolkit。
- リアルタイム・マルチモーダル処理: 低遅延のオーディオ/ビデオストリームのための Pipecat フレームワーク。
エージェント・アーキテクチャとオーケストレーション
NeMo Agent Toolkit は中央ハブとして機能し、モデルとハードウェアを接続します。これはフレームワークに依存しない設計になっており、LangChain、LangGraph、CrewAI などの他のエージェント・フレームワークとの互換性があります。
インテントベースのルーティング
レイテンシとコストを最適化するために、システムはすべてのタスクに単一のモデルを使用するのではなく、ルーター(microsoft/phi-3-mini-128k-instruct モデルなど)を使用して、意図(intent)に基づいてクエリを振り分けます:
- テキストクエリ: 単純な雑談やカジュアルな会話のために、高速なテキストモデルにルーティングされます。
- 視覚クエリ: ユーザーが周囲の環境、外見、または視界内の物体について尋ねた場合、Vision Language Model (VLM) にルーティングされます。
- アクション/ツールリクエスト: 外部情報や物理的なロボットの動作を必要とするタスクのために、ReAct エージェントにルーティングされます。
ReAct によるツール呼び出し
システムは、NeMo Agent Toolkit 内の組み込み ReAct エージェント を利用してツール呼び出しを処理します。これにより、エージェントは最終的な回答を出す前に、Wikipedia 検索の実行や特定のロボット動作のトリガーなど、複数のツール呼び出しの間で推論を行うことができます。安全性と安定性を確保するために、実装では厳密なツールスキーマと、ツール呼び出しの最大回数 (max_tool_calls) の制限が推奨されています。
リアルタイム・インタラクションとハードウェア統合
リアルタイム機能は Pipecat によって管理され、ロボットのカメラ(視覚用)、音声認識(入力用)、および Text-to-Speech(出力用)をオーケストレーションします。
Reachy Mini ロボットは物理的なエンドポイントとして機能します。これはボットサービスが接続するためのデーモンを公開しており、同じ Python コードで物理ロボットまたはシミュレーションのいずれかを制御できます。このアーキテクチャにより、知覚、推論、および行動が物理的なフォームファクタにおいて密接に結合されることが保証されます。
デプロイメントオプション
開発者は、主に以下の3つの方法でこのエージェントスタックをデプロイできます:
- ローカルデプロイ: DGX Spark または十分な VRAM を持つ GPU 上で実行(推論モデルに約 65GB、ビジョンモデルに約 28GB のディスク容量が必要)。
- クラウドデプロイ: NVIDIA Brev または Hugging Face Inference Endpoints を介したクラウド GPU の利用。
- サーバーレスエンドポイント: NVIDIA または Hugging Face Inference Providers を介したリモートエンドポイントへの接続。