OpenMOSS/MOSS-TTS

MOSS‑TTS Family is an open‑source speech and sound generation model family from MOSI.AI and the OpenMOSS team. It is designed for high‑fidelity, high‑expressiveness, and complex real‑world scenarios, covering stable long‑form speech, multi‑speaker dialogue, voice/character design, environmental sound effects, and real‑time streaming TTS.

解決する課題

MOSS-TTS Familyは、複雑な現実世界のオーディオニーズに対応するために設計された、プロダクションレベルの音声・音響生成モデルスイートを提供します。単一のTTSモデルでは、高忠実度の長尺音声、表現力豊かなマルチスピーカー対話、テキストからのゼロショット・ボイスデザイン、低遅延のリアルタイムインタラクション、および環境音の効果音生成を同時に提供できないという制限を解決します。

仕組み

このプロジェクトは、異なるアーキテクチャに基づいた5つの特化型モデルにオーディオ生成ワークフローを分割しています:

  • MOSS-TTS: 発音と持続時間を細かく制御できる、高忠実度・長尺音声およびゼロショット・ボイスクローニングのためのフラッグシップモデル。
  • MOSS-TTSD: 表現力豊かなマルチスピーカーによる超長尺の対話に特化したモデル。
  • MOSS-VoiceGenerator: リファレンスオーディオを必要とせず、テキストプロンプトから多様な声やスタイルを作成するボイスデザインモデル。
  • MOSS-TTS-Realtime: 増分合成とコンテキスト認識を使用して、ターン間のコヒーレンスを維持する音声エージェント向けの低遅延モデル。
  • MOSS-SoundEffect: テキストから環境音や生物音の効果音を生成するモデル。

MossTTSDelay(安定性と速度のため)やMossTTSLocal(軽量ストリーミングのため)のような補完的なアーキテクチャを活用し、MOSS-Audio-Tokenizer-v2を介して48 kHzステレオ出力に対応しています。

対象者

これは、音声エージェントを構築する開発者、映画やゲームを制作するコンテンツクリエイター、および音声合成やオーディオ生成の研究者向けです。

ハイライト

  • 包括的なオーディオスイート: 音声合成や対話から、ボイスデザインやオーディオエフェクトまですべてをカバー。
  • 多言語サポート: コードスイッチング機能を備えた31言語をサポート。
  • 高忠実度: ネイティブの48 kHzステレオ入出力。
  • 柔軟なデプロイ: llama.cppやONNX RuntimeによるPyTorch不要の推論、およびSGLang-OmniやvLLM-Omniのような加速バックエンドをサポート。
  • リアルタイム性能: MOSS-TTS-Realtimeは、TTFB(Time To First Byte)180 msを達成しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト