bakrianoo/mazinger
End-to-end video dubbing pipeline
해결하는 문제
Mazinger Dubber는 동영상 더빙을 위한 엔드투엔드 자동화 파이프라인을 제공합니다. 다운로드, 음성 인식, 번역, 음성 합성 등의 별도 도구를 수동으로 다루지 않아도 되며, 단일 명령어 또는 웹 인터페이스를 통해 완전히 더빙된 오디오 또는 비디오 파일을 생성할 수 있습니다.
작동 방식
시스템은 10단계의 재시도 가능한 단계(다운로드, 음성 인식, 썸네일 생성, 설명, 검토, 번역, 재세그멘테이션, 음성 생성, 조립, 자막 생성)를 연결합니다. 각 단계의 출력을 캐시하므로, 프로세스가 중단된 경우 중단된 지점에서 다시 시작할 수 있습니다. 여러 AI 엔진을 통합합니다:
- 음성 인식: CohereX(Studio 기본값), Faster Whisper, Deepgram Nova 3 사용.
- 번역: LLM(로컬 옵션은 Ollama를 통해 제공).
- 음성 합성: Qwen3-TTS 및 OmniVoice와 같은 음성 클론 TTS 엔진 사용.
- 오디오 처리: 배경음 분리에 Demucs 사용.
대상 사용자
복잡한 개별 AI 툴체인을 관리하지 않고도 원본 화자 음성 유지 또는 미리 정의된 음성 테마 사용을 통해 동영상 콘텐츠를 다양한 언어로 번역하고 싶은 콘텐츠 크리에이터 및 개발자에게 적합합니다.
주요 기능
- 자동 음성 클론: 원본 비디오에서 20~60초 샘플을 자동으로 추출하여 원본 화자의 음성을 클론할 수 있습니다.
- 유연한 음성 인식: 로컬 인식(CohereX, Faster Whisper)과 클라우드 기반 옵션(Deepgram)을 지원합니다.
- 포괄적인 출력: 아랍어와 같은 RTL 언어를 포함한 스타일링된 내장 자막이 있는 더빙 비디오를 생성할 수 있습니다.
- 웹 UI: 명령줄을 사용하지 않고도 사용할 수 있는 Gradio 기반의 "Mazinger Studio" 포함.
- 모듈식 실행: 더빙 프로세스의 각 단계를 독립 명령어로 실행하거나 전체 파이프라인의 일부로 실행할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트