NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

解決的問題

NVIDIA NeMo Speech 為研究人員與開發人員提供了一個全面的工具包,用於建立、自訂與部署先進的語音 AI 模型。透過提供預訓練模型檢查點與標準化的開發框架,它簡化了建構複雜音訊系統的過程,減少了從頭建構語音架構的需求。

工作原理

該工具包基於 PyTorch 建構,允許使用者利用現有程式碼與預訓練權重在三個主要領域開發模型:

  • Automatic Speech Recognition (ASR): 將語音音訊轉換為文字,包括用於即時應用的串流功能。
  • Text to Speech (TTS): 從文字生成自然聽感的語音,包括多語言支援。
  • Speech LLMs: 將語音功能整合至大型語言模型中,實現自然、可中斷且低延遲的語音對話。

適用對象

專為建構以語音為中心的 AI 應用之 AI 研究人員與 PyTorch 開發者設計,範圍涵蓋從高精度離線轉錄到即時串流語音助手。

亮點

  • 多樣化的模型集合: 包括用於串流的 Nemotron-3.5-ASR、用於統一離線/串流推理的 Parakeet,以及用於多語言語音生成的 MagpieTTS 等專業模型。
  • 硬體優化: 與 NVIDIA GPU 與 CUDA 深度整合,並提供選用的加速後端(如 Transformer Engine 與 FlashAttention),用於高性能推理與訓練。
  • 靈活的部署: 支援多種安裝路徑,包括開箱即用的 Docker 容器與保留現有 PyTorch 環境的靈活 pip 安裝。
  • 多語言支援: 提供能夠在 ASR 與 TTS 任務中處理數十種語言的模型。