NVIDIA DGX Spark 和 Reachy Mini 集成指南
在 CES 2026,NVIDIA 通过将 DGX Spark 的处理能力与 Reachy Mini 机器人相结合,推出了一种将 AI 代理带入物理世界的系统。此集成使开发者能够构建一个私人、可定制的办公助手,能够进行实时语音和视觉交互,由开放的推理和视觉模型提供动力。
核心技术组件
该系统构建在开放模型和框架的模块化栈上,使开发者能够在不重写核心逻辑的情况下交换组件。主要的 'ingredients' 包含:
- 推理模型: NVIDIA Nemotron 3 Nano (30B A3B BF16)。
- 视觉模型: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16)。
- 文本转语音: ElevenLabs。
- 硬件/仿真: Reachy Mini (物理硬件或仿真)。
- 编排: NVIDIA NeMo Agent Toolkit。
- 实时多模态处理: Pipecat 框架,用于低延迟音视频流。
代理架构与编排
NeMo Agent Toolkit 作为中心枢纽,将模型与硬件连接。它被设计为与框架无关,并与其他代理框架(如 LangChain、LangGraph 和 CrewAI)兼容。
基于意图的路由
为了优化延迟和成本,系统不对所有任务使用单一模型。而是采用路由器(如 microsoft/phi-3-mini-128k-instruct 模型)根据意图将查询定向:
- 文本查询: 路由到快速文本模型,用于简单的闲聊和随意对话。
- 视觉查询: 当用户询问他们的环境、外观或视野中的对象时,路由到视觉语言模型(VLM)。
- 操作/工具请求: 路由到 ReAct 代理,用于需要外部信息或物理机器人驱动的任务。
使用 ReAct 的工具调用
系统使用 NeMo Agent Toolkit 内置的 ReAct agent 来处理工具调用。这使得代理能够在多次工具调用之间进行推理——例如执行维基百科搜索或触发特定机器人行为——然后再给出最终答案。为确保安全和稳定,实施建议使用严格的工具模式,并对工具调用的最大数量设置硬上限(max_tool_calls)。
实时交互与硬件集成
实时功能由 Pipecat 管理,它协调机器人的摄像头用于视觉,语音识别用于输入,以及文本到语音用于输出。
Reachy Mini 机器人充当物理端点。它暴露出一个守护进程,机器人服务连接到该守护进程,使得相同的 Python 代码可以控制物理机器人或仿真。此架构确保感知、推理和行动在物理形态中紧密耦合。
部署选项
开发者可以通过以下三种主要方法部署此代理栈:
- 本地部署: 在 DGX Spark 或具有足够 VRAM 的 GPU 上运行(推理模型大约需要 65GB 磁盘空间,视觉模型大约需要 28GB)。
- 云部署: 通过 NVIDIA Brev 或 Hugging Face 推理端点使用云 GPU。
- 无服务器端点: 通过 NVIDIA 或 Hugging Face 推理提供商连接到远程端点。