R3gm/SoniTranslate
Synchronized Translation for Videos. Video dubbing
해결하는 문제
SoniTranslate는 오디오를 동기화하면서 동영상을 다른 언어로 번역하는 과정을 간소화합니다. 사용자 친화적인 웹 인터페이스 내에서 전사, 번역, 음성 생성(더빙)을 하나의 종합적인 파이프라인으로 처리할 수 있습니다.
작동 방식
이 애플리케이션은 Gradio 기반 웹 UI를 사용하여 여러 AI 모델과 도구를 조율합니다:
- 전사: faster-whisper 및 WhisperX를 포함한 Whisper 기반 모델을 사용하여 음성을 텍스트로 변환합니다.
- 번역: deep-translator 또는 OpenAI의 GPT API와 같은 도구를 사용하여 전사된 텍스트를 대상 언어로 번역합니다.
- 음성 생성: Piper, Coqui XTTS, BARK, Facebook-mms 등의 다양한 Text-to-Speech (TTS) 엔진을 사용하여 번역된 오디오를 생성합니다. 또한 OpenVoiceV2 및 RVC 모델을 통해 음성 모방도 지원합니다.
- 처리: FFmpeg을 사용하여 멀티미디어 처리를 하고, pyannote-audio를 사용하여 화자 분리(누가 말하고 있는지 식별)를 수행합니다.
대상 사용자
다수의 별도의 전사 및 더빙 도구를 수동으로 조율할 필요 없이 글로벌 청중을 위한 동영상 콘텐츠를 로컬라이즈하고자 하는 콘텐츠 제작자, 교육자 및 관련자.
주요 기능
- 광범위한 언어 지원: 전사 및 번역 모두 다양한 언어를 지원합니다.
- 음성 클론 및 모방: Coqui XTTS 및 OpenVoiceV2와의 통합을 통해 현실적인 음성 클론과 모방이 가능합니다.
- 유연한 입력/출력: YouTube 플레이리스트, 로컬 파일, URL을 지원하며, 출력은 동영상, 오디오, 자막(ASS 및 소프트 자막 포함)이 가능합니다.
- 사용자 정의 가능한 파이프라인: 선호하는 ASR 모델, TTS 엔진, 번역 방법(OpenAI API 통합 포함)을 선택할 수 있습니다.
- 접근성: 로컬 설치 또는 Google Colab 노트북을 통해 이용 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트