CheshireCC/faster-whisper-GUI

faster_whisper GUI with PySide6

해결하는 문제

명령줄 인터페이스를 사용하지 않고 오디오 및 비디오 파일을 음성 인식하려는 사용자를 위해 그래픽 사용자 인터페이스(GUI)를 제공합니다. 음성을 텍스트로 변환하고 생성된 자막 또는 전사본을 관리하는 과정을 간소화합니다.

작동 방식

이 소프트웨어는 faster-whisperwhisperX를 포함한 고성능 음성-텍스트 엔진들을 시각적으로 감싸는 역할을 합니다. 사용자는 애플리케이션 내에서 모델을 직접 로드, 다운로드, 변환할 수 있습니다. 또한 인식 품질을 향상시키기 위해 오디오 소스 분리(AVE)를 위한 Demucs를 통합하고 있습니다.

대상 사용자

미디어 파일에서 자막이나 전사본을 생성해야 하며, 모델 파라미터 조정, 배치 처리 관리, 타임스탬프 편집에 시각적 인터페이스를 선호하는 사용자들입니다.

주요 기능

  • 다양한 형식 내보내기: srt, txt, smi, vtt, lrc 형식으로 전사본 내보내기 지원.
  • 엔진 호환성: faster-whisper, whisperX, large-v3 모델과 호환.
  • 고급 오디오 처리: 오디오 분리용 Demucs 지원.
  • 세부 제어: VAD 모델 및 whisper 모델 파라미터에 완전한 접근 제공.
  • 편집 도구: 타임스탬프 편집이 가능한 내장 결과 뷰어 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트