OpenMOSS/MOSS-TTS-Nano

MOSS-TTS-Nano is an open-source multilingual tiny speech generation model from MOSI.AI and the OpenMOSS team. With only 0.1B parameters, it is designed for realtime speech generation, can run directly on CPU without a GPU, and keeps the deployment stack simple enough for local demos, web serving, and lightweight product integration.

何を解決するか

MOSS-TTS-Nanoは、リアルタイムアプリケーション向けに高品質で多言語対応の音声生成を可能にするように設計されています。従来、リソースを大量に消費するテキスト音声変換(TTS)システムを導入する課題に対処するため、小さなフットプリントと低遅延を備えたモデルを提供し、GPUを必要とせずに標準CPU上で効率的に動作させることができます。

動作方法

このプロジェクトは、音声トークナイザーと大規模言語モデル(LLM)からなる純粋な自己回帰パイプラインを使用しています。具体的には、因果的Transformerブロックに基づくCNNフリーの軽量トークナイザー「MOSS-Audio-Tokenizer-Nano」を採用し、48 kHzステレオ音声をトークンストリームに圧縮します。その後、LLMがこれらのトークンを生成して音声を合成します。デプロイメントには、PyTorch依存を排除したONNX CPU版を提供しており、処理効率を大幅に向上させ、単一のCPUコアでも実行可能となっています。

対象ユーザー

  • ローカルデモ、ウェブサービス、モバイルアプリ(Androidを含む)に軽量TTSを統合したい開発者
  • 最小限のインフラコストでリアルタイムかつ多言語音声生成が必要なプロダクトチーム
  • 小型で効率的な自己回帰音声モデルに興味を持つ研究者

特徴

  • 小型モデルサイズ:パラメータ数わずか0.1B。
  • CPU対応:4コアCPUでストリーミング生成が可能。ONNXを活用することで単一コアでもスムーズな推論が実現。
  • 多言語対応:中国語、英語、ドイツ語、スペイン語、フランス語などを含む20言語をサポート。
  • 高音質:ネイティブ48 kHz、2チャンネル(ステレオ)音声出力。
  • ボイスクローン:リファレンス音声プロンプトを使用したボイスクローンをサポート。
  • 柔軟なデプロイ:パッケージ化されたCLI、FastAPIウェブデモ、ONNXランタイムサポートを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト