OpenMOSS/MOSS-TTSD
MOSS-TTSD is a spoken dialogue generation model designed for expressive multi-speaker synthesis. It features long-context modeling, flexible speaker control, and multilingual support, while enabling zero-shot voice cloning from short audio references.
何を解決するか
MOSS-TTSDは、単一の話者による独白に最適化された従来の音声合成(TTS)システムの限界に対処します。静的な対話スクリプトを一貫性のある連続的な複数話者対話に変換し、長時間の音声生成においても話者の個性や感情のニュアンスを維持します。
仕組み
このモデルは継続的なワークフローを使用しており、ユーザーは各話者(最大5人まで)の参照音声とトランスクリプトを提供します。その後、提供されたスクリプトに基づいて話された対話を生成し、自然な発話の順番と一貫したキャラクターを保証します。高性能なデプロイには、MOSS-Audio-Tokenizerと統合し、SGLang推論エンジンで実行することで生成速度を高速化できます。
対象ユーザー
長時間のオーディオ体験を構築するコンテンツクリエイターおよび開発者向けです。AI生成ポッドキャスト、オーディオブック、スポーツ・エスポート解説、吹き替え、エンタメメディアの制作に適しています。
特徴
- 複数話者対話: 1〜5人の話者をサポートし、重なり合いの発話や自然な会話リズムを柔軟に制御可能。
- 極長文脈: 1回のセッションで最大60分の整合性のある音声を生成可能であり、話者の個性を一貫して維持。
- ゼロショット音声クローン: 短い参照音声サンプルのみで高精細な音声クローンが可能。
- 多言語対応: 中国語、英語、日本語、およびさまざまなヨーロッパ言語を含む20言語で堅牢なパフォーマンスを発揮。
- 高速推論: SGLangとの統合により、推論速度が最大16倍に加速可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト