NVIDIA DGX Spark 和 Reachy Mini 集成指南

在 CES 2026,NVIDIA 通过将 DGX Spark 的处理能力与 Reachy Mini 机器人相结合,推出了一种将 AI 代理带入物理世界的系统。此集成使开发者能够构建一个私人、可定制的办公助手,能够进行实时语音和视觉交互,由开放的推理和视觉模型提供动力。

核心技术组件

该系统构建在开放模型和框架的模块化栈上,使开发者能够在不重写核心逻辑的情况下交换组件。主要的 'ingredients' 包含:

  • 推理模型: NVIDIA Nemotron 3 Nano (30B A3B BF16)。
  • 视觉模型: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16)。
  • 文本转语音: ElevenLabs。
  • 硬件/仿真: Reachy Mini (物理硬件或仿真)。
  • 编排: NVIDIA NeMo Agent Toolkit。
  • 实时多模态处理: Pipecat 框架,用于低延迟音视频流。

代理架构与编排

NeMo Agent Toolkit 作为中心枢纽,将模型与硬件连接。它被设计为与框架无关,并与其他代理框架(如 LangChain、LangGraph 和 CrewAI)兼容。

基于意图的路由

为了优化延迟和成本,系统不对所有任务使用单一模型。而是采用路由器(如 microsoft/phi-3-mini-128k-instruct 模型)根据意图将查询定向:

  • 文本查询: 路由到快速文本模型,用于简单的闲聊和随意对话。
  • 视觉查询: 当用户询问他们的环境、外观或视野中的对象时,路由到视觉语言模型(VLM)。
  • 操作/工具请求: 路由到 ReAct 代理,用于需要外部信息或物理机器人驱动的任务。

使用 ReAct 的工具调用

系统使用 NeMo Agent Toolkit 内置的 ReAct agent 来处理工具调用。这使得代理能够在多次工具调用之间进行推理——例如执行维基百科搜索或触发特定机器人行为——然后再给出最终答案。为确保安全和稳定,实施建议使用严格的工具模式,并对工具调用的最大数量设置硬上限(max_tool_calls)。

实时交互与硬件集成

实时功能由 Pipecat 管理,它协调机器人的摄像头用于视觉,语音识别用于输入,以及文本到语音用于输出。

Reachy Mini 机器人充当物理端点。它暴露出一个守护进程,机器人服务连接到该守护进程,使得相同的 Python 代码可以控制物理机器人或仿真。此架构确保感知、推理和行动在物理形态中紧密耦合。

部署选项

开发者可以通过以下三种主要方法部署此代理栈:

  1. 本地部署: 在 DGX Spark 或具有足够 VRAM 的 GPU 上运行(推理模型大约需要 65GB 磁盘空间,视觉模型大约需要 28GB)。
  2. 云部署: 通过 NVIDIA Brev 或 Hugging Face 推理端点使用云 GPU。
  3. 无服务器端点: 通过 NVIDIA 或 Hugging Face 推理提供商连接到远程端点。

Sources