kadirnar/whisper-plus

WhisperPlus: Faster, Smarter, and More Capable 🚀

解决的问题

WhisperPlus 是一个全面的音视频处理工具包。它简化了将语音转为文本的过程,对生成的转录文本进行摘要,并通过 RAG(检索增强生成)与视频内容进行交互,同时还提供说话人分离和文本转语音的工具。

工作原理

该库提供了一组专门的流水线,封装了现有的 AI 模型。它集成了 Hugging Face 模型(如 Whisper 和 BART)、Apple MLX 以在 Mac 上实现高性能,以及 Pyannote 等其他框架用于说话人识别。它还包含从 YouTube 下载音视频的实用函数,以及一个 RAG 系统,允许用户使用 LLM 与视频转录内容进行“对话”。

适用人群

需要一种简化方式来实现语音转文本、音频摘要和基于视频的问答系统,而无需从零开始构建复杂流水线的开发者和研究人员。

主要亮点

  • 多平台优化:支持 Apple MLX 和 Lightning Whisper,实现 Mac 上的高效执行。
  • 高级 ASR:支持量化(Hqq、BitsAndBytes)和 Flash Attention 2,实现更快的推理速度。
  • 全流程支持:覆盖从 YouTube 下载到转录、说话人分离和自动字幕生成的完整工作流。
  • 集成 RAG:内置功能,可通过 LanceDB 或 AutoLLM 与视频内容进行对话。
  • 额外模态:包含文本转语音(TTS)和文本摘要流水线。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目