kadirnar/whisper-plus

WhisperPlus: Faster, Smarter, and More Capable 🚀

解決する課題

WhisperPlus は、音声および動画処理の包括的なツールキットです。音声をテキストに変換するプロセスを簡素化し、得られたトランスクリプトの要約、RAG(リトリーバー補強生成)を用いた動画コンテンツとの対話を行うとともに、話者ダイアライゼーションやテキストから音声への変換(TTS)のためのツールも提供します。

動作方法

このライブラリは、既存のAIモデルをラップする専用パイプラインのセットを提供します。Hugging Faceモデル(Whisper や BART など)、Mac向けに最適化された Apple MLX、および Pyannote などの話者識別フレームワークと統合されています。YouTubeから音声・動画をダウンロードするユーティリティ関数や、LLMを用いて動画トランスクリプトと「会話」できるRAGシステムも含まれています。

対象ユーザー

音声認識、音声要約、動画ベースのQ&Aシステムを実装する際に、複雑なパイプラインをゼロから構築せずに済ませたい開発者や研究者に最適です。

主な特徴

  • マルチプラットフォーム最適化:Apple MLX および Lightning Whisper をサポートし、Macでの効率的な実行を実現。
  • 高度なASR:量子化(Hqq、BitsAndBytes)および Flash Attention 2 をサポートし、より高速な推論を実現。
  • フルパイプライン対応:YouTubeダウンロードからトランスクリプト、話者ダイアライゼーション、自動字幕生成まで、一連のワークフローをカバー。
  • 統合されたRAG:LanceDB または AutoLLM を用いて、動画コンテンツと会話できる内蔵機能を備える。
  • 追加モダリティ:テキストから音声への変換(TTS)およびテキスト要約パイプラインを含む。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト