shang-zhu/violin

Open-source Video Translation Skill

해결하는 문제

Violin은 자연스러운 느낌을 유지하면서 비디오를 다른 언어로 번역하는 오픈 소스 도구입니다. 원본 음성을 전사하고, 텍스트를 번역하며, 원어민처럼 들리는 음성을 생성하고, 새로운 오디오를 비디오 파일에 다시 동기화하는 복잡한 과정을 자동화합니다.

작동 방식

Violin은 비디오를 처리하기 위해 교체 가능한 AI 모델 파이프라인을 사용합니다:

  1. Audio Extraction: ffmpeg를 사용하여 비디오에서 오디오를 추출합니다.
  2. Transcription: Whisper Large v3를 사용하여 단어 단위 타임스탬프와 문장 세그먼트를 생성합니다.
  3. Translation: LLM(기본적으로 DeepSeek V4 Pro)이 선택된 스타일 프로필을 기반으로 세그먼트를 번역합니다.
  4. Speech Synthesis: TTS 엔진(기본적으로 Cartesia Sonic 3)이 더빙된 오디오를 생성합니다.
  5. Remuxing: ffmpeg가 비디오 속도를 더빙된 오디오에 맞추고, 선택 사항인 SRT 자막과 함께 최종 출력 MP4를 인코딩합니다.

대상 사용자

수동 더빙 서비스 없이 33개의 대상 언어로 글로벌 관객을 위해 비디오 콘텐츠를 현지화해야 하는 콘텐츠 크리에이터 및 개발자.

주요 특징

  • Pluggable Stack: 단일 YAML 설정을 통해 Together AI, OpenAI, ElevenLabs와 같은 제공업체 간을 쉽게 전환할 수 있습니다.
  • Style Profiles: 번역 톤과 TTS 전달 방식을 모두 조정하는 6가지 실험적 프로필(standard, kids, academic, casual, storyteller, news)이 있습니다.
  • In-video Q&A: 샘플링된 프레임과 자막을 사용하여 사용자가 더빙된 비디오의 특정 순간에 대해 질문할 수 있도록 합니다.
  • Natural-language Voice Picker: LLM을 사용하여 사용자의 설명에 따라 카탈로그에서 가장 적합한 목소리를 선택합니다.
  • Flexible Deployment: CLI 도구, FastAPI 웹 앱 또는 Claude Code skill로 사용할 수 있습니다 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트