NVIDIA DGX Spark 및 Reachy Mini 통합 가이드
CES 2026에서 NVIDIA는 DGX Spark의 처리 능력과 Reachy Mini 로봇을 결합하여 물리 세계에 AI 에이전트를 가져오는 시스템을 공개했습니다. 이 통합을 통해 개발자는 오픈 추론 및 비전 모델로 구동되는 실시간 음성 및 시각 상호작용이 가능한 프라이빗하고 맞춤형 사무실 어시스턴트를 구축할 수 있습니다.
핵심 기술 구성 요소
이 시스템은 오픈 모델과 프레임워크의 모듈러 스택 위에 구축되어 개발자가 핵심 로직을 다시 작성하지 않고 구성 요소를 교체할 수 있도록 합니다. 주요 "ingredients" 포함:
- Reasoning Model: NVIDIA Nemotron 3 Nano (30B A3B BF16).
- Vision Model: NVIDIA Nemotron Nano 2 VL (12B v2 VL BF16).
- Text-to-Speech: ElevenLabs.
- Hardware/Simulation: Reachy Mini (physical hardware or simulation).
- Orchestration: NVIDIA NeMo Agent Toolkit.
- Real-time Multimodal Handling: 저지연 오디오/비디오 스트림을 위한 Pipecat 프레임워크.
에이전트 아키텍처 및 오케스트레이션
NeMo Agent Toolkit은 모델을 하드웨어에 연결하는 중앙 허브 역할을 합니다. 프레임워크에 구애받지 않도록 설계되었으며 LangChain, LangGraph, CrewAI와 같은 다른 에이전트 프레임워크와 호환됩니다.
의도 기반 라우팅
지연 시간과 비용을 최적화하기 위해 시스템은 모든 작업에 단일 모델을 사용하지 않습니다. 대신, intent에 따라 쿼리를 라우팅하기 위해 라우터(예: microsoft/phi-3-mini-128k-instruct 모델)를 사용합니다:
- Text Queries: 간단한 잡담과 캐주얼 대화를 위한 빠른 텍스트 모델로 라우팅됩니다.
- Visual Queries: 사용자가 환경, 외모 또는 시야 내 물체에 대해 질문할 때 Vision Language Model(VLM)으로 라우팅됩니다.
- Action/Tool Requests: 외부 정보가 필요하거나 물리적 로봇 구동이 필요한 작업에 대해 ReAct 에이전트로 라우팅됩니다.
ReAct를 사용한 도구 호출
시스템은 NeMo Agent Toolkit 내에 내장된 ReAct 에이전트를 활용하여 도구 호출을 처리합니다.これにより 에이전트는 최종 답변을 제공하기 전에 Wikipedia 검색 수행 또는 특정 로봇 행동 트리거와 같은 여러 도구 호출 사이에서 추론할 수 있습니다. 안전성과 안정성을 보장하기 위해 구현에서는 엄격한 도구 스키마와 도구 호출 수의 상한(max_tool_calls)을 권장합니다.
실시간 상호작용 및 하드웨어 통합
실시간 기능은 Pipecat에 의해 관리되며, 이는 로봇의 카메라를 비전에 orchestrate하고, 입력을 위한 음성 인식, 출력을 위한 텍스트-음성 변환을 담당합니다.
Reachy Mini 로봇은 물리적 엔드포인트로 작동합니다. 봇 서비스가 연결하는 데몬을 노출하여 동일한 Python 코드로 물리적 로봇 또는 시뮬레이션을 제어할 수 있습니다. 이 아키텍처는 인식, 추론, 행동이 물리적 폼 팩터에서紧密하게 결합되도록 보장합니다.
배포 옵션
개발자는 다음 세 가지 주요 방법을 통해 이 에이전트 스택을 배포할 수 있습니다:
- Local Deployment: DGX Spark 또는 충분한 VRAM을 가진 GPU에서 실행됩니다(추론 모델에 약 65GB, 비전 모델에 약 28GB의 디스크 공간이 필요함).
- Cloud Deployment: NVIDIA Brev 또는 Hugging Face Inference Endpoints를 통해 클라우드 GPU를 활용합니다.
- Serverless Endpoints: NVIDIA 또는 Hugging Face Inference Providers를 통해 원격 엔드포인트에 연결합니다.