CheshireCC/faster-whisper-GUI

faster_whisper GUI with PySide6

解决的问题

为希望无需使用命令行界面即可转录音频和视频文件的用户提供图形用户界面(GUI)。简化了将语音转换为文本并管理生成的字幕或转录文本的过程。

工作原理

该软件作为多个高性能语音转文本引擎(包括 faster-whisperwhisperX)的可视化封装。允许用户在应用程序内直接加载、下载和转换模型。还集成了 Demucs 用于音频源分离(AVE),以提升转录质量。

适用人群

需要从媒体文件生成字幕或转录文本,并偏好使用可视化界面调整模型参数、管理批量处理和编辑时间戳的用户。

主要亮点

  • 多格式导出:支持将转录结果导出为 srt、txt、smi、vtt 和 lrc 格式。
  • 引擎支持:兼容 faster-whisperwhisperX 和 large-v3 模型。
  • 高级音频处理:支持 Demucs 用于音频分离。
  • 精细控制:提供对 VAD 模型和 whisper 模型参数的完全访问。
  • 编辑工具:内置结果查看器,支持编辑时间戳。

相关

  • 项目
  • 项目
  • 项目
  • 项目