NVIDIA DGX Spark 與 Reachy Mini 整合指南
在 CES 2026,NVIDIA 揭示了一個系統,透過將 DGX Spark 的運算能力與 Reachy Mini 機器人結合,將 AI 代理帶入實體世界。此整合使開發者能夠構建一個私人且可自訂的辦公室助理,具備即時語音與視覺互動能力,並由開放的推理與視覺模型提供動力。
核心技術組件
該系統建構在開放模型與框架的模組化堆疊上,使開發者能夠在不重寫核心邏輯的情況下交換組件。主要的「成分」包括:
- 推理模型: NVIDIA Nemotron 3 Nano (30B A3B BF16).
- 視覺模型: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16).
- 文字轉語音: ElevenLabs.
- 硬體/模擬: Reachy Mini (實體硬體或模擬)。
- 協調: NVIDIA NeMo Agent Toolkit.
- 實時多模態處理: Pipecat 框架,用於低延遲音訊/視訊串流。
代理架構與協調
NeMo Agent Toolkit 作為中央樞紐,連接模型與硬體。其設計為與框架無關,並與其他代理框架如 LangChain、LangGraph 和 CrewAI 相容。
意圖導向路由
為了優化延遲與成本,系統並不對所有任務使用單一模型。相反地,它使用一個路由器(例如 microsoft/phi-3-mini-128k-instruct 模型)根據意圖來導向查詢:
- 文字查詢: 導向快速文字模型,用於簡單閒聊和隨意對話。
- 視覺查詢: 當使用者詢問他們的環境、外觀或視野中的物體時,導向視覺語言模型(VLM)。
- 動作/工具請求: 導向 ReAct 代理,以處理需要外部資訊或實體機器人驅動的任務。
使用 ReAct 進行工具呼叫
該系統在 NeMo Agent Toolkit 內使用內建的 ReAct agent 來處理工具呼叫。這使得代理能夠在多次工具呼叫之間進行推理——例如執行維基百科搜尋或觸發特定機器人行為——在給出最終答案之前。為確保安全與穩定,實作建議使用嚴格的工具結構,並對工具呼叫的最大數量設定硬上限 (max_tool_calls).
實時互動與硬體整合
實時功能由 Pipecat 管理,它協調機器人的相機進行視覺感知、語音辨識作為輸入,以及文字轉語音作為輸出。
Reachy Mini 機器人作為實體端點。它暴露一個守護進程(daemon),機器人服務連接 thereto,使得相同的 Python 程式碼能夠控制實體機器人或模擬。此架構確保感知、推理與行動在實體形態中緊密耦合。
部署選項
開發者可透過三種主要方式部署此代理堆疊:
- 本地部署: 在 DGX Spark 或具備足夠 VRAM 的 GPU 上運行(推理模型約需 65GB 磁碟空間,視覺模型約需 28GB)。
- 雲端部署: 透過 NVIDIA Brev 或 Hugging Face Inference Endpoints 使用雲端 GPU。
- 無伺服器端點: 透過 NVIDIA 或 Hugging Face Inference Providers 連接遠端端點。