lucasjinreal/Kokoros

🔥🔥 Kokoro in Rust. https://huggingface.co/hexgrad/Kokoro-82M Insanely fast, realtime TTS with high quality you ever have.

解决的问题

Kokoros 是 Kokoro TTS 模型的高性能 Rust 实现,旨在通过高质量的音频输出提供极快的文本转语音(TTS)合成。它通过提供独立二进制文件和 Rust crate,消除了对沉重的 Python 依赖,以便轻松集成到其他应用程序中。

工作原理

该项目通过 ONNX Runtime 使用 Kokoro 82M 参数模型进行推理。它包含内置的音素化器(phonemizer)和分词器(支持 Espeak-ng),用于处理端到端的文本处理。该系统可以用作命令行工具 (koko)、Rust 库,或支持流式音频生成和并行处理以优化吞吐量的 OpenAI 兼容 HTTP API 服务器。

适用对象

  • 希望在 Rust 应用程序中嵌入高质量 TTS 的开发人员。
  • 寻求快速、轻量级音频合成 CLI 工具的用户。
  • 构建需要低延迟、流式音频响应的 AI 智能体或数字人的工程师。

亮点

  • 极速推理:使用 Rust 进行速度优化,支持 CUDA 和 WASM。
  • OpenAI 兼容:提供模拟 OpenAI TTS 端点的 API 服务器,以便于集成。
  • 流式支持:同时支持 CLI 和 HTTP API 流式传输,实现即时音频播放(低首音频延迟)。
  • 风格混合:允许混合不同的语音风格(例如 af_sky.4 + af_nicole.5)以实现自定义语音效果。
  • 词级时间戳:可以生成 .tsv 伴随文件,提供每个单词的精确开始和结束时间。
  • 端到端:包含内部音素化,无需外部依赖。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目