CheshireCC/faster-whisper-GUI

faster_whisper GUI with PySide6

解決的問題

為希望無需使用命令列介面即可轉錄音訊與影片檔案的使用者提供圖形使用者介面(GUI)。簡化將語音轉換為文字,並管理產生的字幕或轉錄內容的流程。

運作方式

此軟體作為多個高效率語音轉文字引擎(包括 faster-whisperwhisperX)的視覺封裝。允許使用者在應用程式內直接載入、下載與轉換模型。同時整合 Demucs 用於音訊來源分離(AVE),以提升轉錄品質。

適用對象

需要從媒體檔案產生字幕或轉錄內容,並偏好使用視覺化介面調整模型參數、管理批次處理與編輯時間戳的使用者。

主要特色

  • 多格式匯出:支援將轉錄結果匯出為 srt、txt、smi、vtt 與 lrc 格式。
  • 引擎支援:相容 faster-whisperwhisperX 與 large-v3 模型。
  • 進階音訊處理:支援 Demucs 用於音訊分離。
  • 細緻控制:提供對 VAD 模型與 whisper 模型參數的完全存取。
  • 編輯工具:內建結果檢視器,支援編輯時間戳。

相關

  • 專案
  • 專案
  • 專案
  • 專案