NVIDIA-NeMo/Speech
A scalable generative AI framework built for researchers and developers working on Large Language Models, Multimodal, and Speech AI (Automatic Speech Recognition and Text-to-Speech)
何を解決するか
NVIDIA NeMo Speechは、研究者や開発者が先進的な音声AIモデルを構築、カスタマイズ、デプロイできる包括的なフレームワークを提供します。自動音声認識(ASR)、テキストから音声への変換(TTS)、音声ベースの大規模言語モデル(Speech LLM)のシステム構築プロセスを簡素化し、事前学習済みのチェックポイントと再利用可能なコードを提供することで、すべてをゼロから書く必要を減らします。
仕組み
PyTorchに基づいて構築されたNeMo Speechは、既存のモデルアーキテクチャとオープンウェイトのチェックポイント(HuggingFace経由で利用可能)を活用して音声アプリケーションを構築できます。ストリーミングASR(制御可能な遅延)、多言語TTS、フルデュプレックスで中断可能な音声会話など、幅広い機能をサポートしています。このツールキットは柔軟性を重視しており、既存のPython/PyTorch/CUDAスタック上にインストールするか、即時デプロイ向けに最適化されたNVIDIA NGCコンテナを使用できます。
対象ユーザー
主にプロフェッショナルな音声モデルの開発、または大規模AIシステムに音声機能を統合するPyTorch開発者やAI研究者向けに設計されています。
主な特徴
- 多様な音声モダリティ: 自動音声認識(ASR)、テキストから音声への変換(TTS)、音声LLMをサポート。
- 高性能ストリーミング: Nemotron-3.5-ASR-Streamingなどのモデルで、制御可能な遅延(80ms〜1秒)と高い同時接続数を実現。
- 多言語対応: MagpieTTSやParakeet/Canaryなど、多数の世界言語をサポートするモデルを含む。
- 高度な会話型AI: Nemotron 3 VoiceChatにより、自然で低遅延、フルデュプレックスの会話が可能。
- 柔軟なデプロイ:
uvによる再現可能なスタックや、最適化されたGPUパフォーマンス向けのDockerコンテナなど、複数のインストール方法を提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト