nazdridoy/kokoro-tts

A CLI text-to-speech tool using the Kokoro model, supporting multiple languages, voices (with blending), and various input formats including EPUB books and PDF documents.

解决的问题

Kokoro TTS 提供了一个命令行接口(CLI),用于将文本转换为高质量、自然流畅的语音。它简化了将长篇内容(如 EPUB 书籍、PDF 文档和文本文件)转换为音频文件或流式音频的过程,无需复杂的设置即可使用 Kokoro 模型。

工作原理

该工具通过 ONNX 使用 Kokoro 模型进行语音合成。它支持多种输入格式,包括通过标准输入(stdin)从其他程序中管道传输文本,并能自动将长文本分割为可管理的段落。支持多种语言,并允许用户通过分配可自定义的权重来混合不同语音,创建混合语音。

适用人群

本工具专为偏好终端工作流、希望将文档或书籍转换为有声书或语音流,而无需图形用户界面的用户设计。

主要亮点

  • 文档支持:直接处理 .epub、.pdf 和 .txt 文件,并支持将输出按章节分割。
  • 语音定制:支持多种语言,可通过可调权重实现语音混合。
  • 灵活输出:支持流式音频播放、WAV 和 MP3 格式,以及音频片段合并。
  • 硬件加速:支持 GPU 以实现更快的合成速度。
  • CLI 集成:支持通过 stdin 从其他程序中管道输入数据。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目