CheshireCC/faster-whisper-GUI

faster_whisper GUI with PySide6

何を解決するか

コマンドラインインターフェースを使用せずにオーディオおよびビデオファイルを音声認識する必要があるユーザー向けに、グラフィカルユーザーインターフェース(GUI)を提供します。音声をテキストに変換し、生成された字幕やトランスクリプトを管理するプロセスを簡素化します。

動作方法

このソフトウェアは、faster-whisper および whisperX を含む高性能音声認識エンジンの視覚的なラッパーとして機能します。アプリケーション内でモデルをロード、ダウンロード、変換できます。また、音声分離(AVE)により認識品質を向上させるために Demucs を統合しています。

対象ユーザー

メディアファイルから字幕やトランスクリプトを生成したいが、モデルパラメータの調整、バッチ処理の管理、タイムスタンプの編集に視覚的なインターフェースを好むユーザー。

特徴

  • マルチフォーマットエクスポート: srt、txt、smi、vtt、lrc 形式へのエクスポートをサポート。
  • エンジン対応: faster-whisperwhisperX、および large-v3 モデルと互換性あり。
  • 高度なオーディオ処理: 音声分離用に Demucs をサポート。
  • 詳細な制御: VADモデルおよびwhisperモデルのパラメータに完全アクセス可能。
  • 編集ツール: タイムスタンプの編集が可能な組み込み結果ビューアを搭載。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト