NVIDIA-NeMo/Speech
A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)
解决的问题
NVIDIA NeMo Speech 为研究人员和开发者提供了一个全面的框架,用于创建、自定义和部署先进的语音 AI 模型。它简化了自动语音识别(ASR)、文本转语音(TTS)以及基于语音的大语言模型(Speech LLM)系统的构建过程,通过提供预训练检查点和可重用代码,减少了从零开始编写所有内容的需求。
如何工作
基于 PyTorch 构建,NeMo Speech 允许开发者利用现有的模型架构和开放权重检查点(可通过 HuggingFace 获取)来构建语音应用。它支持多种功能,包括具有可控延迟的流式 ASR、多语言 TTS 以及全双工、可中断的语音对话。该工具包设计灵活,用户可将其安装在现有的 Python/PyTorch/CUDA 堆栈上,也可使用优化的 NVIDIA NGC 容器实现开箱即用的部署。
适用人群
主要面向正在构建专业级语音模型或在更大 AI 系统中集成语音功能的 AI 研究人员和 PyTorch 开发者。
主要亮点
- 多样化的语音模态:支持自动语音识别(ASR)、文本转语音(TTS)和语音 LLM。
- 高性能流式处理:提供 Nemotron-3.5-ASR-Streaming 等模型,支持可控延迟(80ms-1s)和高并发。
- 多语言支持:包含 MagpieTTS 和 Parakeet/Canary 等模型,支持多种全球语言。
- 先进的对话式 AI:提供 Nemotron 3 VoiceChat,实现自然、低延迟、全双工的语音对话。
- 灵活的部署方式:提供多种安装路径,包括使用
uv实现可复现的环境栈,以及使用 Docker 容器实现优化的 GPU 性能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目