NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

解决的问题

NVIDIA NeMo Speech 为研究人员和开发人员提供了一个全面的工具包,用于创建、定制和部署先进的语音 AI 模型。通过提供预训练模型检查点和标准化的开发框架,它简化了构建复杂音频系统的过程,减少了从头构建语音架构的需求。

工作原理

该工具包基于 PyTorch 构建,允许用户利用现有代码和预训练权重在三个主要领域开发模型:

  • Automatic Speech Recognition (ASR): 将语音音频转换为文本,包括用于实时应用的流式传输功能。
  • Text to Speech (TTS): 从文本生成自然听感的语音,包括多语言支持。
  • Speech LLMs: 将语音功能集成到大语言模型中,实现自然、可中断且低延迟的语音对话。

适用对象

专为构建以语音为中心的 AI 应用的 AI 研究人员和 PyTorch 开发人员设计,范围涵盖从高精度离线转录到实时流式语音助手。

亮点

  • 多样化的模型集合: 包括用于流式传输的 Nemotron-3.5-ASR、用于统一离线/流式推理的 Parakeet 以及用于多语言语音生成的 MagpieTTS 等专业模型。
  • 硬件优化: 与 NVIDIA GPU 和 CUDA 深度集成,并提供可选的加速后端(如 Transformer Engine 和 FlashAttention),用于高性能推理和训练。
  • 灵活的部署: 支持多种安装路径,包括开箱即用的 Docker 容器和保留现有 PyTorch 环境的灵活 pip 安装。
  • 多语言支持: 提供能够在 ASR 和 TTS 任务中处理数十种语言的模型。