NVIDIA-NeMo/Speech
A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)
해결하는 문제
NVIDIA NeMo Speech는 연구자와 개발자가 고급 음성 AI 모델을 생성, 맞춤 설정 및 배포할 수 있는 포괄적인 툴킷을 제공합니다. 사전 학습된 모델 체크포인트와 표준화된 개발 프레임워크를 제공하여 복잡한 오디오 시스템 구축 프로세스를 단순화하고, 음성 아키텍처를 처음부터 구축해야 하는 필요성을 줄여줍니다.
작동 방식
PyTorch를 기반으로 구축된 이 툴킷을 사용하면 사용자는 기존 코드와 사전 학습된 가중치를 활용하여 다음 세 가지 주요 영역에서 모델을 개발할 수 있습니다:
- Automatic Speech Recognition (ASR): 음성 오디오를 텍스트로 변환하며, 실시간 애플리케이션을 위한 스트리밍 기능을 포함합니다.
- Text to Speech (TTS): 텍스트에서 자연스러운 음성을 생성하며, 다국어 지원을 포함합니다.
- Speech LLMs: 자연스럽고 중단 가능하며 저지연 음성 대화를 위해 대규모 언어 모델에 음성 기능을 통합합니다.
대상
고정밀 오프라인 전사부터 실시간 스트리밍 음성 비서에 이르기까지 음성 중심의 AI 애플리케이션을 구축하는 AI 연구자 및 PyTorch 개발자를 위해 설계되었습니다.
주요 특징
- 다양한 모델 컬렉션: 스트리밍을 위한 Nemotron-3.5-ASR, 통합 오프라인/스트리밍 추론을 위한 Parakeet, 다국어 음성 생성을 위한 MagpieTTS와 같은 전문화된 모델을 포함합니다.
- 하드웨어 최적화: NVIDIA GPU 및 CUDA와 깊게 통합되어 있으며, 고성능 추론 및 훈련을 위한 옵션 가속 백엔드(Transformer Engine 및 FlashAttention 등)를 제공합니다.
- 유연한 배포: 즉시 사용 가능한 Docker 컨테인서와 기존 PyTorch 환경을 유지하는 유연한 pip 설치를 포함한 다양한 설치 경로를 지원합니다.
- 다국어 지원: ASR 및 TTS 작업 전반에 걸쳐 수십 개의 언어를 처리할 수 있는 모델을 제공합니다.