cyberofficial/Synthalingua

Synthalingua - Real Time Translation

해결하는 문제

Synthalingua는 실시간 오디오 및 비디오의 언어 장벽을 허물기 위해 설계된 셀프 호스팅 도구입니다. 사용자가 다양한 언어의 오디오를 영어(또는 다른 다국어 출력)로 거의 실시간으로 전사 및 번역할 수 있게 해주며, 특히 라이브 스트림(예: VTuber) 시청이나 동기화된 자막이 포함된 비디오 파일을 처리하는 사용 사례를 대상으로 합니다.

작동 방식

이 도구는 Whisper, FasterWhisper, OpenVINO를 포함한 AI 모델을 활용하여 마이크, HLS 스트림(YouTube, Twitch), 또는 로컬 파일로부터의 오디오 입력을 처리합니다. 전사 및 번역을 위해 GPU(Nvidia CUDA, AMD ROCm)와 CPU 리소스를 모두 활용합니다. 실시간 자막 생성을 위한 웹 기반 비디오 플레이어를 포함하며, SRT 또는 VTT 형식으로 자막을 내보낼 수 있습니다.

대상 사용자

전문적인 번역 서비스에 의존하지 않고 라이브 방송이나 비디오를 이해하고자 하는 취미 생활자, 학생, 그리고 외국어 콘텐츠 팬(예: VTuber 시청자)을 주요 대상으로 합니다.

주요 특징

  • 실시간 번역: 라이브 HLS 스트림, 마이크 입력, 로컬 파일을 지원합니다.
  • 대화형 비디오 UI: 동기화된 자막과 사용자 정의 스타일링이 가능한 웹 기반 플레이어를 제공합니다.
  • 유연한 하드웨어 지원: CPU, Nvidia GPU(CUDA), 그리고 Intel iGPU/dGPU/NPU에서 실행됩니다.
  • 노이즈 및 스팸 필터링: 환각 현상이나 원치 않는 문구를 필터링하기 위한 차단 목록과 반복 억제 기능을 포함합니다.
  • 통합 옵션: 웹훅을 통해 Discord로 번역 결과를 전송하거나 로컬 웹 서버를 통해 표시할 수 있습니다.
  • 자막 생성: 비디오에 자막을 입히거나 트랙으로 삽입할 수 있으며, Demucs를 사용한 선택적 보컬 격리 기능을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트