kadirnar/whisper-plus

WhisperPlus: Faster, Smarter, and More Capable 🚀

解決的問題

WhisperPlus 是一個全面的音訊與影像處理工具包。它簡化了將語音轉換為文字的流程,對產生的轉錄內容進行摘要,並透過 RAG(檢索增強生成)與影片內容互動,同時也提供說話人分離與文字轉語音的工具。

運作方式

此套件提供一組專用的處理流程,包裝現有的 AI 模型。它整合了 Hugging Face 模型(如 Whisper 和 BART)、Apple MLX 以在 Mac 上實現高效能,以及 Pyannote 等其他框架用於說話人辨識。同時也包含從 YouTube 下載音訊/影像的實用函數,以及一個 RAG 系統,讓使用者能使用 LLM 與影片轉錄內容進行「對話」。

適用對象

需要一種簡化方式來實現語音轉文字、音訊摘要與基於影片的問答系統,而無需從零開始建構複雜流程的開發者與研究人員。

主要特色

  • 多平台優化:支援 Apple MLX 與 Lightning Whisper,實現 Mac 上的高效執行。
  • 進階 ASR:支援量化(Hqq、BitsAndBytes)與 Flash Attention 2,實現更快的推論速度。
  • 完整流程支援:涵蓋從 YouTube 下載到轉錄、說話人分離與自動字幕生成的完整工作流程。
  • 整合 RAG:內建功能,可透過 LanceDB 或 AutoLLM 與影片內容對話。
  • 額外模態:包含文字轉語音(TTS)與文字摘要流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案