NVIDIA-NeMo/Speech

A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)

何を解決するか

NVIDIA NeMo Speechは、研究者や開発者が先進的な音声AIモデルを構築、カスタマイズ、デプロイできる包括的なフレームワークを提供します。自動音声認識(ASR)、テキストから音声への変換(TTS)、音声ベースの大規模言語モデル(Speech LLM)のシステム構築プロセスを簡素化し、事前学習済みのチェックポイントと再利用可能なコードを提供することで、すべてをゼロから書く必要を減らします。

仕組み

PyTorchに基づいて構築されたNeMo Speechは、既存のモデルアーキテクチャとオープンウェイトのチェックポイント(HuggingFace経由で利用可能)を活用して音声アプリケーションを構築できます。ストリーミングASR(制御可能な遅延)、多言語TTS、フルデュプレックスで中断可能な音声会話など、幅広い機能をサポートしています。このツールキットは柔軟性を重視しており、既存のPython/PyTorch/CUDAスタック上にインストールするか、即時デプロイ向けに最適化されたNVIDIA NGCコンテナを使用できます。

対象ユーザー

主にプロフェッショナルな音声モデルの開発、または大規模AIシステムに音声機能を統合するPyTorch開発者やAI研究者向けに設計されています。

主な特徴

  • 多様な音声モダリティ: 自動音声認識(ASR)、テキストから音声への変換(TTS)、音声LLMをサポート。
  • 高性能ストリーミング: Nemotron-3.5-ASR-Streamingなどのモデルで、制御可能な遅延(80ms〜1秒)と高い同時接続数を実現。
  • 多言語対応: MagpieTTSやParakeet/Canaryなど、多数の世界言語をサポートするモデルを含む。
  • 高度な会話型AI: Nemotron 3 VoiceChatにより、自然で低遅延、フルデュプレックスの会話が可能。
  • 柔軟なデプロイ: uvによる再現可能なスタックや、最適化されたGPUパフォーマンス向けのDockerコンテナなど、複数のインストール方法を提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト