inworld-ai/tts
Inworld TTS
解决的问题
这个项目提供了创建高质量文本转语音(TTS)系统所需的训练和建模基础设施。它允许开发者使用自己的音频数据对基于 SpeechLM 的模型进行预训练、微调或对齐,支持从单 GPU 配置到大型多 GPU 集群的各种场景。
工作原理
该系统使用 SpeechLM 架构结合 1D 音频编码器,将文本转换为语音。工作流程包括:
- 数据准备:原始音频和转录文本被处理为特定的 JSONL 格式。
- 向量化:使用编码器将音频转换为音频码(兼容 xcodec2)。
- SFT 训练:监督微调(SFT)教会模型根据文本生成音频码。
- RLHF 对齐:基于人类反馈的强化学习(RLHF)通过奖励函数(如词错误率)进一步优化模型,使其输出更符合人类偏好。
- 推理:训练好的模型,配合编码器和解码器,根据文本输入和音频提示生成语音。
适用人群
需要可扩展训练管道(支持分布式训练 DDP、DeepSpeed、FSDP)和 RLHF 对齐功能的 AI 研究人员和工程师,用于构建自定义文本转语音模型。
特色亮点
- 分布式训练:原生支持 DDP、DeepSpeed 和 FSDP,可在多个 GPU 上扩展。
- RLHF 集成:内置对齐能力,支持使用奖励函数,并利用 vLLM 加速训练期间的生成。
- 灵活建模:支持任意 SpeechLM 模型,兼容 xcodec2 检查点。
- 完整流水线:包含可直接使用的脚本,用于数据向量化、分片合并以及模型转换以用于服务。
相关
- 项目
- Dispatch
- 项目
- 项目
- 项目