OpenMOSS/MOSS-TTSD
MOSS-TTSD is a spoken dialogue generation model designed for expressive multi-speaker synthesis. It features long-context modeling, flexible speaker control, and multilingual support, while enabling zero-shot voice cloning from short audio references.
解决的问题
MOSS-TTSD 解决了传统文本转语音(TTS)系统仅针对单说话人独白优化的局限性。它将静态的对话脚本转化为连贯、连续的多说话人对话,确保在长时音频生成过程中保持说话人身份和情感细微差别。
工作原理
该模型采用延续式工作流,用户需为每位说话人(最多5人)提供参考音频和转录文本。随后,基于提供的脚本生成口语对话,确保自然的发言顺序和一致的角色设定。对于高性能部署,可与 MOSS-Audio-Tokenizer 融合,并通过 SGLang 推理引擎运行,以显著加速生成速度。
适用人群
专为构建长时音频体验的内容创作者和开发者设计,例如 AI 生成的播客、有声书、体育与电竞解说、配音以及娱乐媒体。
核心亮点
- 多说话人对话:支持 1 到 5 位说话人,灵活控制重叠发言和自然的对话节奏。
- 超长上下文:单次会话可生成长达 60 分钟的连贯音频,同时保持说话人身份一致。
- 零样本语音克隆:仅需短时参考音频样本即可实现高保真语音克隆。
- 多语言支持:在包括中文、英文、日文及多种欧洲语言在内的 20 种语言中表现稳健。
- 高速推理:与 SGLang 集成后,可实现最高 16 倍的推理加速。
相关
- 项目
- 项目
- 项目
- 项目
- 项目