lucasjinreal/Kokoros
🔥🔥 Kokoro in Rust. https://huggingface.co/hexgrad/Kokoro-82M Insanely fast, realtime TTS with high quality you ever have.
解决的问题
Kokoros 是 Kokoro TTS 模型的高性能 Rust 实现,旨在通过高质量的音频输出提供极快的文本转语音(TTS)合成。它通过提供独立二进制文件和 Rust crate,消除了对沉重的 Python 依赖,以便轻松集成到其他应用程序中。
工作原理
该项目通过 ONNX Runtime 使用 Kokoro 82M 参数模型进行推理。它包含内置的音素化器(phonemizer)和分词器(支持 Espeak-ng),用于处理端到端的文本处理。该系统可以用作命令行工具 (koko)、Rust 库,或支持流式音频生成和并行处理以优化吞吐量的 OpenAI 兼容 HTTP API 服务器。
适用对象
- 希望在 Rust 应用程序中嵌入高质量 TTS 的开发人员。
- 寻求快速、轻量级音频合成 CLI 工具的用户。
- 构建需要低延迟、流式音频响应的 AI 智能体或数字人的工程师。
亮点
- 极速推理:使用 Rust 进行速度优化,支持 CUDA 和 WASM。
- OpenAI 兼容:提供模拟 OpenAI TTS 端点的 API 服务器,以便于集成。
- 流式支持:同时支持 CLI 和 HTTP API 流式传输,实现即时音频播放(低首音频延迟)。
- 风格混合:允许混合不同的语音风格(例如
af_sky.4 + af_nicole.5)以实现自定义语音效果。 - 词级时间戳:可以生成
.tsv伴随文件,提供每个单词的精确开始和结束时间。 - 端到端:包含内部音素化,无需外部依赖。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目