NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

解決的問題

NVIDIA NeMo Speech 為研究人員和開發者提供了一個全面的框架,用於建立、自訂和部署先進的語音 AI 模型。它簡化了自動語音辨識(ASR)、文字轉語音(TTS)以及基於語音的大語言模型(Speech LLM)系統的建構流程,透過提供預訓練檢查點和可重用程式碼,減少從零開始撰寫所有內容的需求。

如何運作

基於 PyTorch 建構,NeMo Speech 允許開發者利用現有的模型架構和開放權重檢查點(可透過 HuggingFace 取得)來建構語音應用。它支援多種功能,包括具可控延遲的串流式 ASR、多語言 TTS 以及全雙工、可中斷的語音對話。此工具包設計靈活,使用者可安裝於現有的 Python/PyTorch/CUDA 堆疊上,或使用優化過的 NVIDIA NGC 容器實現開箱即用的部署。

適用對象

主要針對正在建構專業級語音模型,或在更大 AI 系統中整合語音功能的 AI 研究人員與 PyTorch 開發者。

主要亮點

  • 多樣化的語音模態:支援自動語音辨識(ASR)、文字轉語音(TTS)和語音 LLM。
  • 高效率串流處理:提供 Nemotron-3.5-ASR-Streaming 等模型,支援可控延遲(80ms-1s)與高併發。
  • 多語言支援:包含 MagpieTTS 和 Parakeet/Canary 等模型,支援多種全球語言。
  • 先進的對話式 AI:提供 Nemotron 3 VoiceChat,實現自然、低延遲、全雙工的語音對話。
  • 彈性部署方式:提供多種安裝路徑,包括使用 uv 實現可重現的環境堆疊,以及使用 Docker 容器實現最佳化的 GPU 性能。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案