OpenMOSS/MOSS-TTSD

MOSS-TTSD is a spoken dialogue generation model designed for expressive multi-speaker synthesis. It features long-context modeling, flexible speaker control, and multilingual support, while enabling zero-shot voice cloning from short audio references.

解決的問題

MOSS-TTSD 解決了傳統文字轉語音(TTS)系統僅針對單一講者獨白優化所帶來的限制。它將靜態對話腳本轉換為連貫、持續的多講者對話,確保在長時音訊生成過程中維持講者身份與情感細節。

工作原理

該模型採用延續式工作流程,使用者需為每位講者(最多 5 位)提供參考音訊與轉錄文字。隨後,根據提供的腳本生成口語對話,確保自然的發言順序與一致的角色設定。對於高效率部署,可與 MOSS-Audio-Tokenizer 融合,並透過 SGLang 推理引擎執行,以大幅加速生成速度。

適用對象

專為打造長時音訊體驗的內容創作者與開發者設計,例如 AI 生成的播客、有聲書、體育與電競解說、配音以及娛樂媒體。

核心亮點

  • 多講者對話:支援 1 到 5 位講者,可靈活控制重疊發言與自然的對話節奏。
  • 超長上下文:單次會話可生成長達 60 分鐘的連貫音訊,同時維持講者身份一致。
  • 零樣本語音克隆:僅需短時參考音訊樣本即可實現高保真語音克隆。
  • 多語言支援:在包括中文、英文、日文及多種歐洲語言在內的 20 種語言中表現穩健。
  • 高速推理:與 SGLang 集成後,可實現最高 16 倍的推理加速。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案