NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

해결하는 문제

NVIDIA NeMo Speech는 연구자와 개발자가 고급 음성 AI 모델을 구축, 사용자 정의 및 배포할 수 있도록 포괄적인 프레임워크를 제공합니다. 자동 음성 인식(ASR), 텍스트에서 음성으로 변환(TTS), 음성 기반 대규모 언어 모델(Speech LLM)을 위한 시스템 구축 과정을 단순화하여, 사전 훈련된 체크포인트와 재사용 가능한 코드를 제공함으로써 모든 것을 처음부터 작성할 필요를 줄입니다.

작동 방식

PyTorch 기반으로 구축된 NeMo Speech는 기존 모델 아키텍처와 오픈웨이트 체크포인트(HuggingFace를 통해 제공)를 활용하여 음성 애플리케이션을 개발할 수 있습니다. 스트리밍 ASR(제어 가능한 지연), 다국어 TTS, 완전 이중 방향 및 중단 가능한 음성 대화와 같은 다양한 기능을 지원합니다. 이 툴킷은 유연성을 중시하며, 기존 Python/PyTorch/CUDA 스택 위에 설치하거나, 즉시 사용 가능한 최적화된 NVIDIA NGC 컨테이너를 사용할 수 있습니다.

대상 사용자

주로 프로페셔널 등급의 음성 모델을 개발하거나, 더 큰 AI 시스템에 음성 기능을 통합하는 PyTorch 개발자 및 AI 연구자에게 적합합니다.

주요 특징

  • 다양한 음성 모달리티: 자동 음성 인식(ASR), 텍스트에서 음성으로 변환(TTS), 음성 LLM을 지원합니다.
  • 고성능 스트리밍: Nemotron-3.5-ASR-Streaming과 같은 모델로 제어 가능한 지연(80ms~1초)과 높은 동시성 처리가 가능합니다.
  • 다국어 지원: MagpieTTS, Parakeet/Canary 등 수많은 글로벌 언어를 지원하는 모델을 포함합니다.
  • 고급 대화형 AI: Nemotron 3 VoiceChat를 통해 자연스럽고 낮은 지연, 완전 이중 방향의 대화가 가능합니다.
  • 유연한 배포: uv를 통한 재현 가능한 스택 설치 및 최적화된 GPU 성능을 위한 Docker 컨테이너 등 다양한 설치 경로를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트